{"id":"W4416386275","doi":"10.48550/arxiv.2510.08526","title":"Convergence Theorems for Entropy-Regularized and Distributional Reinforcement Learning","year":2025,"lang":"en","type":"preprint","venue":"ArXiv.org","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Natural Sciences and Engineering Research Council of Canada; Defense Advanced Research Projects Agency; Canadian Institute for Advanced Research","keywords":"Reinforcement learning; Decoupling (probability); Entropy (arrow of time); Regularization (linguistics); Convergence (economics); Principle of maximum entropy","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009642614,0.001796864,0.001564503,0.002023312,0.0009845879,0.002119945,0.00216757,0.002135621,0.00549445],"category_scores_gemma":[0.03992413,0.000745546,0.001815405,0.0009733842,0.004441575,0.003810367,0.003990263,0.005385592,0.001041827],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003545469,"about_ca_system_score_gemma":0.002400893,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002869796,"about_ca_topic_score_gemma":0.002080963,"domain_scores_codex":[0.9973247,0.001246511,0.0001256251,0.0004386579,0.0006430481,0.0002213119],"domain_scores_gemma":[0.981556,0.01433196,0.0008036101,0.001005042,0.001756099,0.000547335],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00009906062,0.00007972341,0.001033173,0.0002066762,0.00007820185,0.00008291947,0.0002305269,0.3023754,0.001283195,0.6654957,0.002244043,0.02679138],"study_design_scores_gemma":[0.00001786657,0.00003356992,0.0001630294,0.00004726403,0.00001111606,0.00002724479,0.00001890386,0.7379206,0.000543938,0.2604043,0.0007945613,0.00001756383],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.005905933,0.000364618,0.9877429,0.0005773299,0.00005484576,0.00005895657,0.00007419924,0.0002334009,0.004987789],"genre_scores_gemma":[0.5720179,0.001719799,0.4089721,0.001003803,0.0003749276,0.001230964,0.0005196867,0.0009863172,0.01317454],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.009642614,"threshold_uncertainty_score":0.05099565,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02809672457499991,"score_gpt":0.2735402910651721,"score_spread":0.2454435664901722,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}