{"id":"W4404851897","doi":"10.1016/j.nuclcard.2024.102089","title":"Evaluating AI proficiency in nuclear cardiology: Large language models take on the board preparation exam","year":2024,"lang":"en","type":"article","venue":"Journal of Nuclear Cardiology","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":16,"is_retracted":false,"has_abstract":true,"ca_institutions":"Artificial Intelligence in Medicine (Canada)","funders":"National Heart, Lung, and Blood Institute; National Institutes of Health; Pfizer; Cedars-Sinai Medical Center; Bristol-Myers Squibb","keywords":"Medicine; Medical physics; Cardiology; Internal medicine","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002418289,0.0001213678,0.0004189153,0.0002348473,0.0001199785,0.00003962055,0.0001385879,0.0001740834,0.00009399599],"category_scores_gemma":[0.0005944249,0.00008013187,0.0002226725,0.0001960564,0.00009522791,0.0001602003,0.00002873978,0.0007932843,0.0001300178],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00021936,"about_ca_system_score_gemma":0.00024535,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00004648715,"about_ca_topic_score_gemma":0.000006257471,"domain_scores_codex":[0.9981538,0.0004589894,0.0006077476,0.0002132507,0.0002738962,0.0002923159],"domain_scores_gemma":[0.9990233,0.0002928038,0.0001403519,0.0002456636,0.0002201653,0.00007775841],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.007024645,0.0007777411,0.01533897,0.001090258,0.00188764,0.004812698,0.258845,0.09559214,0.05329581,0.1782602,0.1865268,0.196548],"study_design_scores_gemma":[0.00123423,0.0231788,0.02435539,0.002903484,0.001299084,0.00875495,0.1222636,0.5721986,0.001018537,0.02466593,0.2169203,0.001207008],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9783754,0.0009585957,0.0001839035,0.01292146,0.001472589,0.0003501552,0.000003650039,0.00003382056,0.005700469],"genre_scores_gemma":[0.9958979,0.0001694433,0.0001321593,0.001945526,0.001732893,0.000006671532,0.000002710442,0.00002989983,0.00008275307],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.4766065,"threshold_uncertainty_score":0.344647,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2059208236008788,"score_gpt":0.4785680898858449,"score_spread":0.2726472662849662,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}