{"id":"W7102329548","doi":"","title":"Causal Deep Q Network","year":2025,"lang":"","type":"article","venue":"ArXiv.org","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Mitacs","keywords":"Spurious relationship; Reinforcement learning; Causal model; Causal reasoning; Benchmark (surveying); Associative property; Causal structure","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0007595739,0.000504122,0.0005102527,0.0001898978,0.000754233,0.0004732387,0.002289227,0.00031519,0.0003377397],"category_scores_gemma":[0.0003162785,0.0005501572,0.0002282666,0.002030822,0.0002644372,0.0006241939,0.001750549,0.0009046151,0.002298425],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000210688,"about_ca_system_score_gemma":0.0004377275,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00004736655,"about_ca_topic_score_gemma":0.00001680697,"domain_scores_codex":[0.9958656,0.0002630771,0.0009055306,0.001020761,0.0005562184,0.001388856],"domain_scores_gemma":[0.9969379,0.0003627293,0.0003360364,0.001880105,0.0002415207,0.0002417159],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00001140503,0.00003469909,0.3834762,0.00005131813,0.0001287388,0.00004203026,0.0003295774,0.5878339,0.00003184624,0.01594913,0.006310136,0.005801048],"study_design_scores_gemma":[0.0006011988,0.0001891193,0.2190735,0.0002847944,0.00009304851,0.000006411613,0.00003498744,0.7208797,0.0001819133,0.0004246139,0.0577013,0.0005294337],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.03931678,0.001448513,0.9191265,0.002445072,0.008450106,0.0003920354,4.55137e-7,0.0002713267,0.02854927],"genre_scores_gemma":[0.9551169,0.0002672379,0.007031834,0.003497725,0.0008230908,0.00001771351,0.000005340997,0.00003310415,0.03320708],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9158001,"threshold_uncertainty_score":0.999695,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02682050421823448,"score_gpt":0.2705352088287046,"score_spread":0.2437147046104702,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}