{"id":"W4404851897","doi":"10.1016/j.nuclcard.2024.102089","title":"Evaluating AI proficiency in nuclear cardiology: Large language models take on the board preparation exam","year":2024,"lang":"en","type":"article","venue":"Journal of Nuclear Cardiology","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":16,"is_retracted":false,"has_abstract":true,"ca_institutions":"Artificial Intelligence in Medicine (Canada)","funders":"National Heart, Lung, and Blood Institute; National Institutes of Health; Pfizer; Cedars-Sinai Medical Center; Bristol-Myers Squibb","keywords":"Medicine; Medical physics; Cardiology; Internal medicine","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01067354,0.0008723647,0.0005933102,0.0007565003,0.0002961541,0.002002278,0.0009314389,0.0009424129,0.003626796],"category_scores_gemma":[0.05601491,0.0002754012,0.0009120427,0.0003656491,0.0006527748,0.001719219,0.002129665,0.001229761,0.002239241],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000875067,"about_ca_system_score_gemma":0.0009499721,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001660491,"about_ca_topic_score_gemma":0.002236691,"domain_scores_codex":[0.9934664,0.003724344,0.000527675,0.0008637251,0.001027838,0.0003898646],"domain_scores_gemma":[0.9551847,0.03163871,0.005183436,0.002077832,0.002946314,0.002968979],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.002532783,0.003316153,0.8583798,0.000311732,0.0002690415,0.0003861462,0.007118009,0.008591176,0.005048346,0.0003721295,0.005394874,0.1082798],"study_design_scores_gemma":[0.0003025787,0.008457054,0.9101895,0.0003268017,0.0002430834,0.00103879,0.005704501,0.05113382,0.01188819,0.002114348,0.00840151,0.0001997651],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9944047,0.00008642065,0.002218431,0.0001769556,0.00002159182,0.0001240725,0.0001798897,0.0001049403,0.002682992],"genre_scores_gemma":[0.9957924,0.00009065304,0.002693603,0.0001207424,0.00001878945,0.0001411747,0.0004608639,0.00003523768,0.0006466188],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01067354,"threshold_uncertainty_score":0.05644774,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2059208236008788,"score_gpt":0.4785680898858449,"score_spread":0.2726472662849662,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}