{"id":"W4416690664","doi":"10.1136/bmjqs-2025-019299","title":"Artificial intelligence chain-of-thought reasoning in nuanced medical scenarios: mitigation of cognitive biases through model intransigence","year":2025,"lang":"en","type":"article","venue":"BMJ Quality & Safety","topic":"Clinical Reasoning and Diagnostic Skills","field":"Medicine","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"Health Sciences Centre; Sunnybrook Health Science Centre; University of Toronto","funders":"Canadian Institutes of Health Research; Canada Research Chairs; Physicians' Services Incorporated Foundation","keywords":"Cognitive bias; Cognition; Diversity (politics); Motivated reasoning; Confirmation bias; Cognitive computing; Model-based reasoning; MEDLINE","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.02847684,0.0009297366,0.0005646147,0.0007523969,0.000592484,0.00250292,0.001474881,0.001276162,0.002346392],"category_scores_gemma":[0.152551,0.0005135684,0.001062188,0.0003695761,0.002700768,0.003604896,0.004050868,0.00293697,0.0002802094],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001466368,"about_ca_system_score_gemma":0.002386642,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001555971,"about_ca_topic_score_gemma":0.002053682,"domain_scores_codex":[0.9808193,0.01414805,0.0009757163,0.001664103,0.002016822,0.0003760622],"domain_scores_gemma":[0.8183422,0.1486143,0.01263977,0.01502442,0.003821876,0.001557471],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.006298518,0.001809653,0.1599829,0.00251564,0.001480875,0.001026966,0.02600541,0.3668405,0.03689618,0.0506778,0.004197434,0.3422681],"study_design_scores_gemma":[0.0008053866,0.002377652,0.01699804,0.0006514461,0.0006037828,0.0005541058,0.002121683,0.8030586,0.01533187,0.1487701,0.008486532,0.0002407778],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8116504,0.0003111855,0.1768769,0.003279077,0.00009132908,0.0004626993,0.0001988584,0.000802366,0.006327161],"genre_scores_gemma":[0.9291264,0.00009271329,0.06970517,0.00043342,0.00002803053,0.0001660354,0.0001247562,0.00003476264,0.000288691],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9715232,"threshold_uncertainty_score":0.1506017,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1043412490593225,"score_gpt":0.4636136965642572,"score_spread":0.3592724475049347,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}