{"id":"W4417114071","doi":"10.1016/j.chest.2025.11.034","title":"Evaluating the Accuracy of Large Language Models in Answering Asthma Multiple Choice and Objective Structured Clinical Examination Questions","year":2025,"lang":"en","type":"article","venue":"CHEST Journal","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":1,"is_retracted":false,"has_abstract":false,"ca_institutions":"Women's College Hospital; St. Michael's Hospital; Sunnybrook Health Science Centre; Health Sciences Centre; Canada Research Chairs; University of Toronto","funders":"","keywords":"Objective structured clinical examination; Multiple choice; Asthma; Physical examination; MEDLINE; Family history","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009180712,0.001822701,0.001010169,0.001586782,0.0006694143,0.001871375,0.001538976,0.003042561,0.001781082],"category_scores_gemma":[0.03100586,0.0005835317,0.001471339,0.0008615929,0.0005925106,0.002302094,0.00124798,0.002215599,0.001435661],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001288475,"about_ca_system_score_gemma":0.001558165,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.02589926,"about_ca_topic_score_gemma":0.02262897,"domain_scores_codex":[0.9957059,0.002582693,0.0003699945,0.0007186626,0.0004066192,0.0002161208],"domain_scores_gemma":[0.9483703,0.04763602,0.0007059362,0.001054921,0.001590842,0.000642062],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.01403167,0.006688628,0.1672735,0.001163507,0.003040681,0.001172179,0.00138568,0.3663279,0.01363098,0.001347134,0.02513057,0.3988075],"study_design_scores_gemma":[0.000241015,0.0007786209,0.0129965,0.00005090319,0.000377925,0.0001686229,0.0003682512,0.9797187,0.003215274,0.001011913,0.001019859,0.00005247027],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.966175,0.002988128,0.01924889,0.002173263,0.0004272373,0.0002015524,0.003576443,0.002361862,0.002847681],"genre_scores_gemma":[0.9737279,0.0005896994,0.01477409,0.0004571037,0.0001627019,0.00009761228,0.008305656,0.0001010333,0.001784187],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02589926,"threshold_uncertainty_score":0.05149704,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.218908992916085,"score_gpt":0.5402041957403951,"score_spread":0.3212952028243101,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}