{"id":"W4293155040","doi":"","title":"Dynamic Programming in Distributional Reinforcement Learning","year":2020,"lang":"en","type":"report","venue":"HAL (Le Centre pour la Communication Scientifique Directe)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université du Québec à Montréal","funders":"","keywords":"Reinforcement learning; Computer science; Reinforcement; Dynamic programming; Artificial intelligence; Psychology; Algorithm; Social psychology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.006901232,0.0004663687,0.0005390624,0.0003181591,0.0003888571,0.0007725556,0.002394274,0.0003329566,0.00008297304],"category_scores_gemma":[0.004938642,0.0005275152,0.0002475942,0.001117257,0.0001619701,0.0003903618,0.001696532,0.001502068,0.0001068904],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000963141,"about_ca_system_score_gemma":0.001469698,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000525552,"about_ca_topic_score_gemma":0.0003151395,"domain_scores_codex":[0.9929319,0.00256984,0.001053144,0.001048178,0.001716245,0.0006806925],"domain_scores_gemma":[0.993818,0.001022185,0.0009883047,0.001611836,0.002309821,0.0002498026],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00002962456,0.000827661,0.02135236,0.001660284,0.0004955524,0.0002089846,0.01692584,0.4147933,0.0006161073,0.2489683,0.00638615,0.2877358],"study_design_scores_gemma":[0.0004840044,0.000001802557,0.00252498,0.001754331,0.00002427727,0.00003221961,0.00004572445,0.7514139,0.0005024621,0.0001863568,0.2423893,0.0006406295],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0001820537,0.0003610306,0.9095304,0.004612946,0.0003176401,0.0004949332,0.000005170303,0.0004292778,0.08406655],"genre_scores_gemma":[0.8132269,0.001518098,0.1350835,0.00009284415,0.00004701463,0.0001684668,0.002404661,0.0001015441,0.0473569],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.8130449,"threshold_uncertainty_score":0.9997177,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01766060272860948,"score_gpt":0.252790648297136,"score_spread":0.2351300455685265,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}