{"id":"W4416386275","doi":"10.48550/arxiv.2510.08526","title":"Convergence Theorems for Entropy-Regularized and Distributional Reinforcement Learning","year":2025,"lang":"en","type":"preprint","venue":"ArXiv.org","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Natural Sciences and Engineering Research Council of Canada; Defense Advanced Research Projects Agency; Canadian Institute for Advanced Research","keywords":"Reinforcement learning; Decoupling (probability); Entropy (arrow of time); Regularization (linguistics); Convergence (economics); Principle of maximum entropy","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0006740281,0.0004165439,0.0004581998,0.0001366612,0.0003921929,0.000261735,0.001296249,0.0002901071,0.00005274872],"category_scores_gemma":[0.0005395836,0.0004153726,0.0002088105,0.0001904915,0.0001706012,0.0002183277,0.002764703,0.0007921497,0.00003064935],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001881878,"about_ca_system_score_gemma":0.0003409201,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00002708684,"about_ca_topic_score_gemma":6.173638e-7,"domain_scores_codex":[0.9973632,0.0001213162,0.0006129103,0.00089163,0.0004581051,0.0005528551],"domain_scores_gemma":[0.9978532,0.0003879413,0.0004528599,0.0008731842,0.0002905728,0.0001422727],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00004330386,0.00002136501,0.05038478,0.0003229131,0.0002148505,0.000004878712,0.0003819924,0.6941576,0.0004852516,0.252959,0.0004650201,0.0005590425],"study_design_scores_gemma":[0.0009719594,0.0001398171,0.009572036,0.0002809938,0.00007318678,0.000003724107,0.00003025449,0.9706381,0.001482149,0.003317915,0.01292697,0.0005628784],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02109927,0.0001609881,0.9746228,0.0008614014,0.00149032,0.0008638929,0.00001313919,0.0002620578,0.000626094],"genre_scores_gemma":[0.9748452,0.000217887,0.01434719,0.0002798929,0.000174607,0.0002113165,0.0003596508,0.00001838754,0.009545915],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9602757,"threshold_uncertainty_score":0.9998298,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02809672457499991,"score_gpt":0.2735402910651721,"score_spread":0.2454435664901722,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}