{"id":"W4410596951","doi":"10.1186/s12909-025-07235-2","title":"Challenging cases of hyponatremia incorrectly interpreted by ChatGPT","year":2025,"lang":"en","type":"article","venue":"BMC Medical Education","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Hyponatremia; Medical education; Psychology; Medicine; Internal medicine","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.001042118,0.0004846531,0.0003271817,0.00119071,0.0006128133,0.0007638526,0.000571127,0.0007298086,0.001841992],"category_scores_gemma":[0.008179612,0.0001961082,0.0003358851,0.0008187551,0.0007496853,0.0006869589,0.00101218,0.0004755811,0.0005282888],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007169201,"about_ca_system_score_gemma":0.0008443016,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003446012,"about_ca_topic_score_gemma":0.005128537,"domain_scores_codex":[0.9988348,0.0003038276,0.0002517794,0.0001642458,0.0002959432,0.0001493845],"domain_scores_gemma":[0.9967601,0.001143756,0.0009347553,0.0002603641,0.0005686719,0.0003323208],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0007741323,0.0001008138,0.7710508,0.0003475495,0.00006645148,0.1666096,0.004621866,0.000670515,0.01794641,0.0002580019,0.002930125,0.0346238],"study_design_scores_gemma":[0.00006830059,0.0007310974,0.387772,0.0003360092,0.0002151282,0.5491521,0.006398971,0.005642066,0.03686319,0.001176122,0.01151162,0.0001334277],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9917766,0.0006375606,0.003340289,0.0004005269,0.00007691956,0.0000899147,0.0001727025,0.0001587162,0.003346786],"genre_scores_gemma":[0.9954384,0.0003288794,0.00320618,0.0002872841,0.00004628459,0.00002007331,0.0001565435,0.00003023173,0.0004861848],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9989579,"threshold_uncertainty_score":0.006851912,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05957610378163433,"score_gpt":0.439724282767759,"score_spread":0.3801481789861247,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}