{"id":"W4412052969","doi":"10.1101/2025.07.04.25330845","title":"Evaluating the accuracy and consistency of ChatGPT for the management of type 2 diabetes: A cross-sectional study","year":2025,"lang":"en","type":"preprint","venue":"medRxiv","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Lunenfeld-Tanenbaum Research Institute; Sinai Health System","funders":"","keywords":"Consistency (knowledge bases); Type 2 diabetes; Cross-sectional study; Statistics; Computer science; Psychology; Diabetes mellitus; Mathematics; Medicine; Artificial intelligence; Endocrinology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.04965183,0.0004905823,0.0008924195,0.001761431,0.0008783549,0.002069241,0.001190724,0.001501769,0.001797319],"category_scores_gemma":[0.1766395,0.000797523,0.001554955,0.001470997,0.001144389,0.002421691,0.001630082,0.00189983,0.0006458711],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008328159,"about_ca_system_score_gemma":0.0007625152,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003858331,"about_ca_topic_score_gemma":0.003111495,"domain_scores_codex":[0.962281,0.02158838,0.005664056,0.003672378,0.006040026,0.0007541258],"domain_scores_gemma":[0.7106236,0.1845991,0.05093624,0.01829198,0.03231344,0.003235542],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.000313572,0.0004354151,0.9890639,0.0001315175,0.000247835,0.00008116481,0.003674159,0.0002166863,0.0002704253,0.00005064735,0.0004800276,0.005034673],"study_design_scores_gemma":[0.00004510788,0.001448521,0.9873406,0.0001561281,0.0002773092,0.0006222281,0.003217397,0.004321705,0.0009799321,0.0001460996,0.001382671,0.00006220472],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9960427,0.000269165,0.001923124,0.0001730553,0.00003667872,0.0002075244,0.0006238049,0.00004406411,0.0006799374],"genre_scores_gemma":[0.9966931,0.0001232967,0.001842612,0.0001709042,0.00003353952,0.0002489997,0.0006578644,0.00003048806,0.0001992459],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.04965183,"threshold_uncertainty_score":0.2625871,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.3387498573818665,"score_gpt":0.5343024245627148,"score_spread":0.1955525671808483,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}