{"id":"W4401418726","doi":"10.1213/ane.0000000000007088","title":"Comparative Analysis of Machine-Learning Model Performance in Image Analysis: The Impact of Dataset Diversity and Size","year":2024,"lang":"en","type":"article","venue":"Anesthesia & Analgesia","topic":"Voice and Speech Disorders","field":"Medicine","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University; McGill University Health Centre","funders":"","keywords":"Artificial intelligence; Machine learning; Metric (unit); Computer science; Diversity (politics); Recall; Performance metric; Precision and recall; Data mining","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.01729469,0.001304914,0.001190526,0.00306338,0.0007492576,0.002503138,0.001317418,0.001354513,0.0007741827],"category_scores_gemma":[0.04331649,0.0003141859,0.001848341,0.002102435,0.001063323,0.002803717,0.001784732,0.001416387,0.0005170672],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001246549,"about_ca_system_score_gemma":0.001128163,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00280739,"about_ca_topic_score_gemma":0.002138811,"domain_scores_codex":[0.9905218,0.003890237,0.001259731,0.001779305,0.002198068,0.0003508977],"domain_scores_gemma":[0.9436997,0.0421078,0.002658691,0.006277605,0.004539332,0.0007169924],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.005783116,0.00120819,0.1927141,0.001903986,0.002751168,0.0006010794,0.0006893342,0.3624772,0.02349239,0.001974188,0.008760942,0.3976443],"study_design_scores_gemma":[0.0002474071,0.003673284,0.09682167,0.0003846631,0.0007487844,0.001333306,0.0007190888,0.8295845,0.05333601,0.004533818,0.00843128,0.0001861898],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9180704,0.007822127,0.06375412,0.001189094,0.0003647686,0.0004144298,0.003308351,0.001677351,0.003399404],"genre_scores_gemma":[0.9435517,0.001055958,0.04704969,0.0001947863,0.000124184,0.0002174352,0.007204748,0.0001717153,0.0004297782],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9827053,"threshold_uncertainty_score":0.09146416,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02157861523646576,"score_gpt":0.3071330659976518,"score_spread":0.2855544507611861,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}