{"id":"W2097113539","doi":"10.1613/jair.898","title":"Accelerating Reinforcement Learning through Implicit Imitation","year":2003,"lang":"en","type":"article","venue":"Journal of Artificial Intelligence Research","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":176,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto; University of British Columbia","funders":"Instituto de Ciencias del Mar y Limnología, Universidad Nacional Autónoma de México; Natural Sciences and Engineering Research Council of Canada","keywords":"Imitation; Reinforcement learning; Observability; Computer science; Convergence (economics); Action (physics); Space (punctuation); Artificial intelligence; State space; Reinforcement; Value (mathematics); Human–computer interaction; Machine learning; Psychology; Mathematics; Social psychology","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001404605,0.0006531003,0.0006546348,0.0002413794,0.0002388503,0.0005002687,0.001374361,0.0007705024,0.001365311],"category_scores_gemma":[0.006951879,0.0003390074,0.0003097387,0.0002146271,0.001272889,0.001375793,0.001438488,0.001236566,0.0002230647],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005211018,"about_ca_system_score_gemma":0.0007868782,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001665948,"about_ca_topic_score_gemma":0.00133283,"domain_scores_codex":[0.9993852,0.0002355182,0.00002810632,0.0001086033,0.0001555496,0.00008695967],"domain_scores_gemma":[0.9958956,0.002361286,0.0004724326,0.0008455461,0.0002799573,0.0001452509],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002196725,0.0001504349,0.001664664,0.00008514465,0.00003645266,0.0001354901,0.0001825914,0.9001032,0.009209661,0.03314264,0.0003907284,0.05467931],"study_design_scores_gemma":[0.00002473221,0.00006284487,0.00009283708,0.000003032261,0.000004061013,0.00001602996,0.000004221215,0.9924014,0.001091234,0.006090937,0.0002048386,0.000003915628],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1190772,0.00008316888,0.877167,0.000175195,0.00002136296,0.00005266925,0.00001648662,0.0007377224,0.002669093],"genre_scores_gemma":[0.9457831,0.00004690671,0.05264583,0.00003366066,0.000008167231,0.00006776935,0.00001938844,0.00002341401,0.001371906],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.001665948,"threshold_uncertainty_score":0.007428288,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2541885736812509,"score_gpt":0.4324161648659641,"score_spread":0.1782275911847133,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}