{"id":"W4409363352","doi":"10.1609/aaai.v39i22.34542","title":"Nuance Matters: Probing Epistemic Consistency in Causal Reasoning","year":2025,"lang":"en","type":"article","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","topic":"Epistemology, Ethics, and Metaphysics","field":"Arts and Humanities","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"École Polytechnique Fédérale de Lausanne","keywords":"Epistemology; Consistency (knowledge bases); Causal reasoning; Psychology; Philosophy; Computer science; Artificial intelligence; Cognition","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03112463,0.0006632573,0.001264722,0.004440784,0.003401734,0.008347813,0.002879839,0.002498635,0.003812101],"category_scores_gemma":[0.2841994,0.0008882466,0.001463517,0.002916525,0.009147225,0.02073115,0.008354309,0.004786344,0.0004745538],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002720018,"about_ca_system_score_gemma":0.002319233,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003590988,"about_ca_topic_score_gemma":0.002841688,"domain_scores_codex":[0.9709,0.01689469,0.002115292,0.004609173,0.004630431,0.0008504211],"domain_scores_gemma":[0.711532,0.223577,0.02123846,0.03151862,0.009938695,0.00219525],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.001212026,0.0003862181,0.1251739,0.0008861593,0.0006136695,0.0007529775,0.04033898,0.04903652,0.007006691,0.6268772,0.001841544,0.1458741],"study_design_scores_gemma":[0.00007214939,0.0001301361,0.01499837,0.0001761796,0.0001700042,0.0003354793,0.003870136,0.1259392,0.005369514,0.844879,0.003945359,0.0001143886],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3884695,0.0004851022,0.5904716,0.002569056,0.00007162408,0.0001876969,0.0004450516,0.0009446818,0.01635564],"genre_scores_gemma":[0.9578052,0.00004984281,0.04125139,0.0001298532,0.00002611968,0.00006620237,0.0002194366,0.0001421803,0.0003097283],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.03112463,"threshold_uncertainty_score":0.1646047,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1036567007710688,"score_gpt":0.3092672336486346,"score_spread":0.2056105328775658,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}