{"id":"W4415534993","doi":"10.1016/j.adro.2025.101929","title":"ChatGPT Versus DeepSeek: Assessing Artificial Intelligence Performance on Radiation Oncology Examination Questions","year":2025,"lang":"en","type":"article","venue":"Advances in Radiation Oncology","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Radiation oncology; MEDLINE; Medical physicist; Radiation therapy","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.01031479,0.001179749,0.0007013899,0.0008347191,0.0003036145,0.001710274,0.001311328,0.001317227,0.003276458],"category_scores_gemma":[0.06504105,0.0005120373,0.001008234,0.0004803702,0.0006279994,0.002398729,0.002202407,0.00177438,0.001348317],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001536708,"about_ca_system_score_gemma":0.001249812,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005899285,"about_ca_topic_score_gemma":0.005427898,"domain_scores_codex":[0.9926542,0.003909378,0.000805109,0.001358859,0.0009976104,0.0002749059],"domain_scores_gemma":[0.8739885,0.111651,0.00502156,0.004171497,0.0032246,0.001942908],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.02344858,0.004132798,0.3984185,0.002306137,0.001721041,0.0004147903,0.007102513,0.146049,0.01538977,0.001332138,0.01644681,0.3832378],"study_design_scores_gemma":[0.001101079,0.007780274,0.1908207,0.0002880179,0.0005820055,0.0004129228,0.001612178,0.7691602,0.01877944,0.002697495,0.006478661,0.0002870765],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9821594,0.0002543032,0.0101703,0.0003877167,0.00006368945,0.0003363798,0.00115477,0.002116428,0.003356943],"genre_scores_gemma":[0.983026,0.00009298735,0.01254328,0.000242236,0.0000296876,0.0003250242,0.002145392,0.0001755917,0.001419777],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9896852,"threshold_uncertainty_score":0.05455047,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.113197509616978,"score_gpt":0.5116446984048433,"score_spread":0.3984471887878653,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}