{"id":"W4417498530","doi":"10.2196/84251","title":"Evaluating the Accuracy of Medical Information Generated by ChatGPT and Gemini and Its Alignment With International Clinical Guidelines From the Surviving Sepsis Campaign: Comparative Study","year":2025,"lang":"en","type":"article","venue":"JMIR Formative Research","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Sepsis; MEDLINE; Clinical Practice; Medical information; Medical literature","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.05714993,0.0005270768,0.0009987868,0.003782459,0.0006330817,0.001970115,0.0009047873,0.001355833,0.001548314],"category_scores_gemma":[0.2695452,0.0002930304,0.0009956581,0.002378336,0.001622772,0.002274196,0.002685333,0.001076147,0.0006683777],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002004134,"about_ca_system_score_gemma":0.001516712,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003064462,"about_ca_topic_score_gemma":0.003033206,"domain_scores_codex":[0.9279407,0.05102871,0.006572132,0.003414813,0.009794558,0.001249125],"domain_scores_gemma":[0.5734357,0.3346766,0.03238804,0.0125686,0.04235162,0.004579359],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.008481487,0.002356637,0.7655141,0.002641588,0.0007531826,0.0007547156,0.0696873,0.002535283,0.002489119,0.0006638129,0.003312831,0.14081],"study_design_scores_gemma":[0.0004598426,0.008703504,0.9334248,0.001101162,0.0006174507,0.0010941,0.02210711,0.01924704,0.004722985,0.0006710173,0.007624626,0.0002261902],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9941102,0.0004025616,0.001882041,0.0002172713,0.00006283672,0.0004751683,0.0003652262,0.00009231548,0.002392433],"genre_scores_gemma":[0.9936885,0.0003142034,0.003955715,0.0001930552,0.00007270922,0.0005196113,0.0006685951,0.00003898887,0.0005485212],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9428501,"threshold_uncertainty_score":0.3022413,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.5974214419949946,"score_gpt":0.6725433682878437,"score_spread":0.07512192629284908,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}