{"id":"W2109651326","doi":"10.2196/medinform.4321","title":"Benchmarking Clinical Speech Recognition and Information Extraction: New Data, Methods, and Evaluations","year":2015,"lang":"en","type":"article","venue":"JMIR Medical Informatics","topic":"Hospital Admissions and Outcomes","field":"Medicine","cited_by":57,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"National Institute of General Medical Sciences; Australian Research Council; National Institutes of Health; University of Queensland; Queensland University of Technology; Griffith University; University of Melbourne; Monash University; Australian Government; University of Sydney; Australian National University; University of New South Wales; ACT Government","keywords":"Computer science; Handover; Workflow; Benchmarking; Natural language processing; Information extraction; Speech recognition; Correctness; Data extraction; Artificial intelligence; Information retrieval; Database; MEDLINE","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.04063324,0.002947222,0.001520469,0.00579564,0.001361806,0.004450198,0.003685854,0.003158567,0.004631859],"category_scores_gemma":[0.08533188,0.0006884243,0.001427991,0.003193813,0.002034284,0.005358351,0.005126625,0.002184011,0.004588806],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002404212,"about_ca_system_score_gemma":0.002673816,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007402404,"about_ca_topic_score_gemma":0.007146609,"domain_scores_codex":[0.9385746,0.03024236,0.008892573,0.008438648,0.01251459,0.001337286],"domain_scores_gemma":[0.9168649,0.04789301,0.002637611,0.01169816,0.01880483,0.002101495],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.005307677,0.003307181,0.04319793,0.005109269,0.001319716,0.0007584441,0.002803331,0.02573515,0.02039734,0.001648394,0.03392102,0.8564945],"study_design_scores_gemma":[0.003064485,0.01294106,0.1588559,0.003351605,0.002283221,0.005880105,0.007363202,0.4509543,0.1898952,0.01296704,0.1512038,0.001240155],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"methods","genre_scores_codex":[0.5034848,0.02113065,0.3921052,0.00516057,0.00247718,0.005915438,0.02145352,0.02985544,0.01841709],"genre_scores_gemma":[0.6095489,0.003570687,0.3057405,0.001261274,0.0005510873,0.003038404,0.06936641,0.001851,0.005071739],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.04063324,"threshold_uncertainty_score":0.2148917,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2116328860060116,"score_gpt":0.5129666329524059,"score_spread":0.3013337469463943,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}