{"id":"W4409491863","doi":"10.2196/63677","title":"Assessing the Quality and Reliability of ChatGPT’s Responses to Radiotherapy-Related Patient Queries: Comparative Study With GPT-3.5 and GPT-4","year":2025,"lang":"en","type":"article","venue":"JMIR Cancer","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":15,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Readability; Quality Score; Likert scale; Reliability (semiconductor); Misinformation; Quality (philosophy); Computer science; Medicine; Comprehension; Medical physics; Metric (unit); Statistics; Mathematics","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02419583,0.0006188313,0.001220222,0.001906409,0.0005952152,0.001231189,0.0009636355,0.001001603,0.002298192],"category_scores_gemma":[0.1459343,0.000393209,0.001350945,0.001460255,0.001217908,0.001286804,0.002236955,0.001107315,0.0009948356],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001318334,"about_ca_system_score_gemma":0.001149252,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002619506,"about_ca_topic_score_gemma":0.002792011,"domain_scores_codex":[0.9762371,0.01396559,0.002997237,0.002090862,0.003975487,0.0007337035],"domain_scores_gemma":[0.8071991,0.1282963,0.02328225,0.009234366,0.02653077,0.005457241],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.01289557,0.00320193,0.7419964,0.002564337,0.001022179,0.001240961,0.07752564,0.002444951,0.006975604,0.0002322247,0.004553205,0.145347],"study_design_scores_gemma":[0.0004545073,0.009797315,0.9571265,0.0003327132,0.0004768188,0.001367604,0.0135423,0.007629919,0.003644699,0.0002450512,0.00517402,0.0002084794],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9964982,0.0001813219,0.001251097,0.0001318671,0.00004628422,0.000405907,0.0004068834,0.0001068804,0.0009715047],"genre_scores_gemma":[0.9945177,0.0002037349,0.002592111,0.0001784245,0.00006381991,0.0008116586,0.0007707746,0.00007083035,0.0007909829],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02419583,"threshold_uncertainty_score":0.1279613,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1761122054590457,"score_gpt":0.54766975135184,"score_spread":0.3715575458927943,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}