{"id":"W4404515893","doi":"10.1016/j.radonc.2024.110645","title":"Evaluating ChatGPT’s competency in radiation oncology: A comprehensive assessment across clinical scenarios","year":2024,"lang":"en","type":"article","venue":"Radiotherapy and Oncology","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":10,"is_retracted":false,"has_abstract":false,"ca_institutions":"London Health Sciences Centre","funders":"","keywords":"Radiation oncology; Medical physics; Medicine; Clinical Oncology; Oncology; Internal medicine; Radiation therapy; Cancer","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00645349,0.0003589121,0.0004706832,0.001725973,0.0007446042,0.001737899,0.001331609,0.001133445,0.003817434],"category_scores_gemma":[0.03888407,0.0002315274,0.000632898,0.0006622786,0.0009246423,0.001684372,0.003205756,0.00128696,0.001008472],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001843001,"about_ca_system_score_gemma":0.004731822,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003465735,"about_ca_topic_score_gemma":0.007240077,"domain_scores_codex":[0.9962177,0.001273939,0.0003721178,0.0002961013,0.001401457,0.0004387004],"domain_scores_gemma":[0.9788697,0.008583719,0.002478305,0.001133966,0.004894817,0.004039532],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0005099529,0.001903414,0.6706348,0.001026906,0.0002218962,0.003053599,0.01475208,0.01415355,0.003824676,0.002714878,0.01487661,0.2723276],"study_design_scores_gemma":[0.0001220074,0.00318953,0.8239768,0.002153374,0.0002434877,0.01758893,0.02762901,0.03838103,0.008830084,0.008759968,0.06881395,0.0003117931],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9558125,0.0007947237,0.0118575,0.001844663,0.0001104904,0.0007832419,0.0006352874,0.0002365681,0.02792495],"genre_scores_gemma":[0.9776294,0.0007091688,0.01768689,0.0004384945,0.00002439716,0.0003374753,0.0008817054,0.00003909556,0.002253294],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.00645349,"threshold_uncertainty_score":0.03412968,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2889155035968126,"score_gpt":0.6125826247130879,"score_spread":0.3236671211162753,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}