{"id":"W4401418726","doi":"10.1213/ane.0000000000007088","title":"Comparative Analysis of Machine-Learning Model Performance in Image Analysis: The Impact of Dataset Diversity and Size","year":2024,"lang":"en","type":"article","venue":"Anesthesia & Analgesia","topic":"Voice and Speech Disorders","field":"Medicine","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University; McGill University Health Centre","funders":"","keywords":"Artificial intelligence; Machine learning; Metric (unit); Computer science; Diversity (politics); Recall; Performance metric; Precision and recall; Data mining","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0004101798,0.0001567927,0.000726652,0.0005099792,0.0001142536,0.00001561559,0.0001418119,0.00005170631,0.00007896522],"category_scores_gemma":[0.00002121788,0.0001004976,0.0003352382,0.002721113,0.0001562562,0.0001690915,0.00008003981,0.0002272076,0.000002257743],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00002903353,"about_ca_system_score_gemma":0.00005925995,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002460624,"about_ca_topic_score_gemma":0.000343047,"domain_scores_codex":[0.9989654,0.00008888018,0.0002833474,0.0002457254,0.0002470708,0.0001695655],"domain_scores_gemma":[0.9993142,0.0001731911,0.0001026101,0.0002915888,0.00005787145,0.00006050741],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0001721944,0.00008052448,0.9549533,0.00008214477,0.005958065,0.00007086561,0.004722575,0.03332154,0.0002861785,0.00004572942,0.000185757,0.0001211641],"study_design_scores_gemma":[0.0001497133,0.00009103533,0.5327401,0.00002061791,0.005468894,0.000007103059,0.0004733411,0.460924,0.00004850444,0.000009655124,0.00001191301,0.00005514254],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9980391,0.00119927,0.0001208834,0.0002799033,0.000001189738,0.0001211519,0.00006854539,0.00001372711,0.0001562319],"genre_scores_gemma":[0.9989595,0.000446217,0.0001159851,0.00005474667,0.00000420391,0.000002383072,0.0003540006,0.000005664976,0.00005729783],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.4276024,"threshold_uncertainty_score":0.4098172,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02157861523646576,"score_gpt":0.3071330659976518,"score_spread":0.2855544507611861,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}