{"id":"W4411520416","doi":"10.7759/cureus.86512","title":"Evaluating the Reliability of OpenAI’s ChatGPT-4 in Providing Pre-colonoscopy Patient Guidance","year":2025,"lang":"en","type":"article","venue":"Cureus","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Medicine; Colonoscopy; Reliability (semiconductor); Medical physics; Internal medicine; Colorectal cancer; Cancer","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0621522,0.000347586,0.0005434731,0.001452174,0.0008245714,0.001901888,0.001149015,0.001036464,0.001162052],"category_scores_gemma":[0.2500892,0.0003893946,0.0009156701,0.001092708,0.001742128,0.001321895,0.0039578,0.001346995,0.0003183645],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002945426,"about_ca_system_score_gemma":0.00486735,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005813342,"about_ca_topic_score_gemma":0.007041396,"domain_scores_codex":[0.9305378,0.05300896,0.005899275,0.001683426,0.007345878,0.001524681],"domain_scores_gemma":[0.5965514,0.3083438,0.03171161,0.01249929,0.04607048,0.004823424],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.001849041,0.001071122,0.6900799,0.003094406,0.0003458132,0.0004551343,0.1415118,0.002270554,0.004719582,0.0008554597,0.004823956,0.1489232],"study_design_scores_gemma":[0.000384339,0.006809857,0.8062883,0.002394854,0.0005010816,0.0007788708,0.1339394,0.01558404,0.007377486,0.00133167,0.02417937,0.00043077],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9892384,0.0001775186,0.003439626,0.0009150952,0.00007108492,0.00145936,0.0004754086,0.0001355146,0.004087911],"genre_scores_gemma":[0.9810343,0.0001945974,0.01489672,0.0006674449,0.00003435877,0.002085436,0.0004646506,0.00003664249,0.0005857054],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.0621522,"threshold_uncertainty_score":0.3286961,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1759566244019135,"score_gpt":0.5157350008044245,"score_spread":0.339778376402511,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}