{"id":"W4415160834","doi":"10.48550/arxiv.2504.10397","title":"Can LLMs Assist Expert Elicitation for Probabilistic Causal Modeling?","year":2025,"lang":"en","type":"preprint","venue":"ArXiv.org","topic":"Explainable Artificial Intelligence (XAI)","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Natural Sciences and Engineering Research Council of Canada; University of Calgary","keywords":"Expert elicitation; Bayesian network; Probabilistic logic; Entropy (arrow of time); Robustness (evolution); Bayesian probability; Causal model; Causal inference; Transparency (behavior)","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0005549116,0.0004167363,0.0004444518,0.0002403841,0.000320624,0.0003180345,0.001824167,0.0003429541,0.000009575458],"category_scores_gemma":[0.0008848385,0.0004355504,0.0002217981,0.0003695663,0.00007885,0.0002782234,0.001113956,0.0004678515,0.00005380186],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0004172281,"about_ca_system_score_gemma":0.0007923336,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002055469,"about_ca_topic_score_gemma":0.001068593,"domain_scores_codex":[0.9969308,0.000115906,0.000700651,0.001280035,0.0003626532,0.0006099683],"domain_scores_gemma":[0.9970893,0.0003437204,0.0002375138,0.001484585,0.0006957243,0.0001491456],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001216183,0.000867918,0.01324518,0.001581574,0.0003639899,0.0000636035,0.01980386,0.5841652,0.00250042,0.3283413,0.005338781,0.04360663],"study_design_scores_gemma":[0.0001027201,0.00007666556,0.0003745347,0.0002365602,0.00002678496,0.000001626563,0.0001911424,0.9116322,0.00421028,0.08173033,0.0009036477,0.0005134759],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1597991,0.0002157792,0.8311848,0.004067849,0.002193404,0.001247299,0.00003449666,0.0003755205,0.0008817185],"genre_scores_gemma":[0.9676729,0.00003424452,0.02854362,0.001023021,0.0003646095,0.001096844,0.0000771689,0.00003122967,0.001156329],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.8078738,"threshold_uncertainty_score":0.9998096,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1132032458476235,"score_gpt":0.3423743979090132,"score_spread":0.2291711520613897,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}