{"id":"W2950638477","doi":"10.48550/arxiv.1112.1133","title":"Multi-timescale Nexting in a Reinforcement Learning Robot","year":2011,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"Alberta Innovates","keywords":"Laptop; Reinforcement learning; Computer science; Feature (linguistics); Range (aeronautics); Artificial intelligence; Robot; Function (biology); Temporal difference learning; Bellman equation; Representation (politics); State (computer science); Dimension (graph theory); Machine learning; Algorithm; Mathematics; Mathematical optimization; Engineering","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0006594327,0.0003433895,0.0004030569,0.0001534817,0.0002940163,0.0003058684,0.0008423285,0.0005891015,0.001278536],"category_scores_gemma":[0.001542364,0.0002374061,0.0002398124,0.0001342688,0.000713881,0.000724709,0.0006214938,0.0008502164,0.000200781],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0004688578,"about_ca_system_score_gemma":0.0004884786,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003694496,"about_ca_topic_score_gemma":0.002720161,"domain_scores_codex":[0.9998085,0.00004908046,0.000008680336,0.00006235339,0.00004220515,0.00002920272],"domain_scores_gemma":[0.9995252,0.0002263252,0.00005216199,0.00007672048,0.00005820899,0.00006127258],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003879162,0.0002053593,0.002011017,0.00004046395,0.00002611206,0.0002260273,0.0001560454,0.9053127,0.02062238,0.006251015,0.0006162528,0.06414478],"study_design_scores_gemma":[0.00001956533,0.0000602836,0.0001728241,0.000001818188,0.000003084336,0.00001759498,0.000006625321,0.9957485,0.001820822,0.001894279,0.0002502339,0.000004443184],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3853763,0.0001469341,0.6086079,0.0004688817,0.00006833801,0.00006076636,0.00004164007,0.001876948,0.00335221],"genre_scores_gemma":[0.9338747,0.00002565837,0.06457379,0.0000398379,0.000008258105,0.00003018279,0.00002066058,0.00002252703,0.001404418],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.003694496,"threshold_uncertainty_score":0.007345974,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1086868290083088,"score_gpt":0.2030623659292932,"score_spread":0.09437553692098442,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}