{"id":"W4409726734","doi":"10.1101/2025.04.22.25326204","title":"Artificial Intelligence in Neuro-Oncology: Assessing ChatGPT’s Accuracy in MRI Interpretation and Treatment Advice","year":2025,"lang":"en","type":"preprint","venue":"medRxiv","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Advice (programming); Interpretation (philosophy); Medical physics; Medicine; Psychology; Artificial intelligence; Oncology; Computer science","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02616172,0.0006094899,0.000683662,0.001920908,0.0005548812,0.002160429,0.001317925,0.001180719,0.001473441],"category_scores_gemma":[0.1461299,0.0003305058,0.00115452,0.001223025,0.001229186,0.001383152,0.002580235,0.0009900503,0.0006130566],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00115732,"about_ca_system_score_gemma":0.001321946,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003788881,"about_ca_topic_score_gemma":0.003733529,"domain_scores_codex":[0.9825459,0.01171324,0.001858708,0.001627896,0.001789342,0.0004649371],"domain_scores_gemma":[0.8722944,0.08872179,0.01767602,0.007081329,0.01152201,0.00270442],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.001703109,0.0003278171,0.9083729,0.0005279529,0.0004143973,0.0003801897,0.004123741,0.008169343,0.0009133227,0.0003259849,0.002369058,0.07237206],"study_design_scores_gemma":[0.0002350218,0.002922475,0.7798479,0.000861018,0.0008103439,0.002535041,0.006907352,0.1870415,0.006444909,0.003651302,0.00848412,0.0002591287],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.984176,0.0006711448,0.01011497,0.0007669671,0.00008090931,0.0003694204,0.0009389127,0.0003733823,0.002508207],"genre_scores_gemma":[0.9901958,0.0001692074,0.008377871,0.0001197048,0.00003091471,0.0001653834,0.0006731227,0.00003231866,0.0002357266],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02616172,"threshold_uncertainty_score":0.1383581,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1392533426790938,"score_gpt":0.4657184510381541,"score_spread":0.3264651083590604,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}