{"id":"W4399774223","doi":"10.1001/jamanetworkopen.2024.17641","title":"Performance of Large Language Models on Medical Oncology Examination Questions","year":2024,"lang":"en","type":"article","venue":"JAMA Network Open","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":72,"is_retracted":false,"has_abstract":true,"ca_institutions":"Institute for Clinical Evaluative Sciences; Vector Institute; University of Toronto; Princess Margaret Cancer Centre; University Health Network","funders":"","keywords":"Clinical Oncology; Medicine; Harm; Oncology; Internal medicine; Clinical trial; Set (abstract data type); Family medicine; Psychology; Cancer; Computer science","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.03099279,0.002242362,0.001419826,0.002135007,0.0007356591,0.002517823,0.001501395,0.002504024,0.003936469],"category_scores_gemma":[0.1303331,0.000621304,0.001692423,0.001020674,0.0007441336,0.003075493,0.003062814,0.002381344,0.002245805],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002045567,"about_ca_system_score_gemma":0.002280595,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01004144,"about_ca_topic_score_gemma":0.007730708,"domain_scores_codex":[0.9753459,0.01913588,0.00141931,0.002457545,0.001226495,0.0004147501],"domain_scores_gemma":[0.8061004,0.1801392,0.004175943,0.004173023,0.003666331,0.001745155],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.01779033,0.003179308,0.2128254,0.001448325,0.002194353,0.0004849284,0.002220505,0.1878351,0.004044783,0.001843212,0.02326489,0.5428689],"study_design_scores_gemma":[0.000583071,0.001583654,0.02173651,0.0002663672,0.00032595,0.0002026701,0.0008434781,0.9647,0.003351434,0.003781526,0.002490929,0.0001342494],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9379139,0.003442311,0.03754117,0.003795085,0.00046444,0.0005383374,0.003929783,0.005537809,0.006837121],"genre_scores_gemma":[0.9723927,0.0003316383,0.02053121,0.0005324515,0.0001310505,0.0002143856,0.004508554,0.0001523839,0.001205678],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9690072,"threshold_uncertainty_score":0.1639075,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1192965486447497,"score_gpt":0.4667730081895255,"score_spread":0.3474764595447757,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}