{"id":"W4385791672","doi":"10.1017/9781009258227.018","title":"Reinforcement Learning","year":2023,"lang":"en","type":"book-chapter","venue":"Cambridge University Press eBooks","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":24,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Computer science; Generative grammar; Code (set theory); Reinforcement learning; Implementation; Artificial intelligence; Software engineering; Programming language","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0005087687,0.0009389168,0.0007006828,0.0004345176,0.0003798081,0.001744986,0.001286586,0.001095134,0.0975894],"category_scores_gemma":[0.00184631,0.0003597569,0.0005121444,0.0006176858,0.0005495104,0.00171702,0.0009164346,0.002115077,0.0421693],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001133477,"about_ca_system_score_gemma":0.001028889,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002162649,"about_ca_topic_score_gemma":0.00332965,"domain_scores_codex":[0.9996032,0.00006041209,0.00002357912,0.0001013333,0.0001844412,0.00002705364],"domain_scores_gemma":[0.9996027,0.000134538,0.00002017944,0.0000606396,0.0001516896,0.00003022472],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.00004487161,0.0000530613,0.0002066655,0.0003471716,0.00003009304,0.00007471362,0.00008464597,0.01615674,0.0009823764,0.09406121,0.3446124,0.543346],"study_design_scores_gemma":[0.00001843723,0.00004521792,0.0002973956,0.000261627,0.00001574776,0.0002054024,0.00004199315,0.01919411,0.0008316539,0.06319319,0.9158662,0.00002899795],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"other","genre_gemma":"empirical","genre_scores_codex":[0.002824583,0.03016741,0.3730391,0.008333347,0.006948766,0.000157009,0.002996281,0.005996612,0.5695369],"genre_scores_gemma":[0.04170441,0.01607569,0.1028185,0.002481875,0.001160169,0.0002656549,0.003865589,0.001216458,0.8304116],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.0975894,"threshold_uncertainty_score":0.3264691,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03100131681971751,"score_gpt":0.2074911771978943,"score_spread":0.1764898603781768,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}