{"id":"W3168260200","doi":"10.48550/arxiv.2106.11779","title":"Emphatic Algorithms for Deep Reinforcement Learning","year":2021,"lang":"en","type":"article","venue":"arXiv (Cornell University)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Reinforcement learning; Computer science; Temporal difference learning; Artificial intelligence; Weighting; Convergence (economics); Context (archaeology); Algorithm; Machine learning; Stability (learning theory); Lambda; Function (biology)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003058732,0.0009888178,0.0008050213,0.0006026553,0.0004231413,0.0009796867,0.001494038,0.001436674,0.005375316],"category_scores_gemma":[0.01169176,0.0006226811,0.0005617011,0.0004854545,0.001320054,0.001501916,0.002038261,0.003232529,0.001017795],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001154838,"about_ca_system_score_gemma":0.00142719,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001254434,"about_ca_topic_score_gemma":0.001900695,"domain_scores_codex":[0.9990252,0.0004076514,0.00008386968,0.0001700544,0.0002521535,0.00006112068],"domain_scores_gemma":[0.9967494,0.002127372,0.0002257527,0.0003404751,0.0004547415,0.0001022662],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00013848,0.00009614781,0.0007552831,0.0001969426,0.00005765142,0.0000568276,0.0001091644,0.6479113,0.002217643,0.1856886,0.004839935,0.157932],"study_design_scores_gemma":[0.00001867665,0.0000257239,0.00002953065,0.00001199117,0.000004094649,0.00001527419,0.000004561719,0.961928,0.0004971216,0.03630927,0.001150578,0.000005158065],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.001847427,0.000097622,0.9963007,0.0001290683,0.00003307967,0.00003325041,0.00001924566,0.0002333572,0.001306336],"genre_scores_gemma":[0.2399127,0.0002798919,0.7538307,0.0004876311,0.0001061941,0.0005212708,0.0001739336,0.0002575673,0.004430077],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.005375316,"threshold_uncertainty_score":0.01798224,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06650257069781514,"score_gpt":0.2029712036247547,"score_spread":0.1364686329269396,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}