{"id":"W4402906886","doi":"10.1016/j.ijrobp.2024.07.1431","title":"Evaluating ChatGPT's Competency in Radiation Oncology: A Comprehensive Assessment across Clinical Scenarios","year":2024,"lang":"en","type":"article","venue":"International Journal of Radiation Oncology*Biology*Physics","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":1,"is_retracted":false,"has_abstract":false,"ca_institutions":"Western University; London Health Sciences Centre","funders":"","keywords":"Radiation oncology; Medical physics; Medicine; Clinical Oncology; Oncology; Medical education; Psychology; Internal medicine; Radiation therapy; Cancer","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.005953213,0.0003627054,0.0004997167,0.001662133,0.0007544995,0.001621746,0.001333455,0.0009529709,0.003933505],"category_scores_gemma":[0.03385598,0.0002341367,0.0006535287,0.0006270135,0.0008023932,0.001597073,0.003193872,0.001224865,0.0009756678],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001951327,"about_ca_system_score_gemma":0.004910564,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004088157,"about_ca_topic_score_gemma":0.008981978,"domain_scores_codex":[0.9969285,0.0009149807,0.0003055687,0.0002729228,0.001206205,0.0003718273],"domain_scores_gemma":[0.9811142,0.007279748,0.002464131,0.0009232509,0.00433342,0.003885163],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0004426362,0.00233712,0.7120583,0.0008500835,0.0002035288,0.00211164,0.01203568,0.01188993,0.003407439,0.001798894,0.01297312,0.2398916],"study_design_scores_gemma":[0.000121703,0.003229937,0.8725922,0.001454254,0.0002199589,0.01077243,0.02083337,0.03041768,0.006424151,0.005449034,0.04822787,0.0002575111],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.968082,0.0005408901,0.007459765,0.001292324,0.00008303201,0.0007657043,0.0005998864,0.0002145953,0.02096194],"genre_scores_gemma":[0.9817124,0.0005871076,0.01382694,0.0003633955,0.00001998986,0.0003473628,0.0008481609,0.00003659117,0.002257991],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9940468,"threshold_uncertainty_score":0.03148395,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2206380371670893,"score_gpt":0.5793429042549739,"score_spread":0.3587048670878846,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}