{"id":"W6987579751","doi":"","title":"Temporal credit assignment via traces in reinforcement learning","year":2020,"lang":"en","type":"dissertation","venue":"eScholarship@McGill (McGill)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"","keywords":"Reinforcement learning; Function (biology); Q-learning; Reinforcement; Bellman equation; Temporal difference learning; Variance (accounting); Value (mathematics)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","research_integrity"],"consensus_categories":[],"category_scores_codex":[0.001392347,0.001169868,0.001133865,0.0007582445,0.000982419,0.0004654492,0.002823512,0.0008759283,0.0002422689],"category_scores_gemma":[0.0007857525,0.001306706,0.0003665211,0.001342551,0.00005515756,0.001929276,0.000632511,0.003873614,0.0007609089],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00145387,"about_ca_system_score_gemma":0.0001632239,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0002474852,"about_ca_topic_score_gemma":0.0001843107,"domain_scores_codex":[0.9920458,0.0005918996,0.001914062,0.00186023,0.002289608,0.00129843],"domain_scores_gemma":[0.9962502,0.0003011303,0.00143761,0.001179207,0.0002797621,0.0005520587],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000228039,0.0002100554,0.0003116695,0.0008225073,0.000375727,0.0006283997,0.0002295241,0.7812454,0.01456045,0.08658453,0.00003794598,0.1147657],"study_design_scores_gemma":[0.005826158,0.003977322,0.002645084,0.002855825,0.0003683486,0.00007836128,0.001206973,0.4591037,0.07276021,0.009492977,0.4339125,0.007772517],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"other","genre_gemma":"empirical","genre_scores_codex":[0.2346313,0.001231683,0.03272106,0.000738133,0.02013337,0.009253732,0.0001081352,0.006082939,0.6950997],"genre_scores_gemma":[0.9754571,0.0001707016,0.006785064,0.0003399558,0.0001011492,0.0002058476,0.0008581937,0.0001902549,0.01589171],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.7408259,"threshold_uncertainty_score":0.9989383,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01857803569777591,"score_gpt":0.2430754551619413,"score_spread":0.2244974194641654,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}