{"id":"W4411039051","doi":"10.21203/rs.3.rs-6725427/v1","title":"Across Generations, Sizes, and Types, Large Language Models Poorly Report Self-Confidence in Gastroenterology Clinical Reasoning Tasks","year":2025,"lang":"en","type":"preprint","venue":"Research Square","topic":"Clinical Reasoning and Diagnostic Skills","field":"Medicine","cited_by":2,"is_retracted":false,"has_abstract":false,"ca_institutions":"Ontario Tech University","funders":"American College of Gastroenterology","keywords":"Confidence interval; Self-confidence; Psychology; Internal medicine; Computer science; Medicine; Social psychology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01015182,0.001079055,0.0007366573,0.0007408917,0.0004907769,0.003960797,0.001008068,0.001487542,0.009336323],"category_scores_gemma":[0.09353741,0.001066455,0.0008421892,0.0005870339,0.001198235,0.003979716,0.002102725,0.003811121,0.002138721],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006801322,"about_ca_system_score_gemma":0.0006598752,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004969175,"about_ca_topic_score_gemma":0.005256674,"domain_scores_codex":[0.9952602,0.00244019,0.0002973483,0.001218961,0.0005812976,0.000202025],"domain_scores_gemma":[0.8404316,0.1242429,0.008549674,0.02127075,0.003071572,0.002433503],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.002047035,0.001358807,0.8394843,0.0002007337,0.001301343,0.0005644569,0.008897964,0.01149121,0.01218241,0.0035552,0.01240449,0.1065119],"study_design_scores_gemma":[0.000400892,0.0008758483,0.8211519,0.0003106332,0.001167235,0.001965138,0.005504449,0.0906413,0.01168072,0.05603873,0.009945952,0.0003172863],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9885122,0.0001977487,0.005598684,0.001038442,0.0000742933,0.00003227703,0.001192396,0.0002894173,0.003064637],"genre_scores_gemma":[0.9921972,0.00009224185,0.002527429,0.0004625858,0.00003208701,0.00004756093,0.001835204,0.0003143291,0.002491408],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01015182,"threshold_uncertainty_score":0.05368859,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0712675693048107,"score_gpt":0.4935816800114692,"score_spread":0.4223141107066585,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}