{"id":"W2950638477","doi":"10.48550/arxiv.1112.1133","title":"Multi-timescale Nexting in a Reinforcement Learning Robot","year":2011,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"Alberta Innovates","keywords":"Laptop; Reinforcement learning; Computer science; Feature (linguistics); Range (aeronautics); Artificial intelligence; Robot; Function (biology); Temporal difference learning; Bellman equation; Representation (politics); State (computer science); Dimension (graph theory); Machine learning; Algorithm; Mathematics; Mathematical optimization; Engineering","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0006360683,0.0004773246,0.000488015,0.0005630418,0.0002033562,0.0001935836,0.002562241,0.000398146,0.00009099402],"category_scores_gemma":[0.0001553378,0.0005936707,0.0002002687,0.0007364312,0.00009900327,0.000598883,0.004435643,0.001745616,0.0002810704],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0004648556,"about_ca_system_score_gemma":0.00022569,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0005084017,"about_ca_topic_score_gemma":0.0000373466,"domain_scores_codex":[0.9969993,0.0002436182,0.0005360264,0.001309749,0.0001733757,0.0007379832],"domain_scores_gemma":[0.9975402,0.0001405966,0.0006230388,0.001359464,0.0001357328,0.0002010054],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00001298769,0.00004285435,0.005618142,0.00006825582,0.00004717666,0.0002367875,0.0009601305,0.9818726,0.00006304692,0.01073449,0.00002029942,0.0003232219],"study_design_scores_gemma":[0.0007476204,0.00009605377,0.001476785,0.0002375703,0.00002857411,0.000003268904,0.0001035655,0.9956574,0.00009888723,0.0006240113,0.0003157488,0.0006105514],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01164652,0.00003672665,0.9776686,0.00002599872,0.0005232035,0.0004292534,2.901158e-7,0.0004040504,0.009265334],"genre_scores_gemma":[0.962208,0.0001298612,0.02697297,0.00006589174,0.00004308345,0.000002433787,0.00001421807,0.00003428704,0.01052929],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.9506956,"threshold_uncertainty_score":0.9996515,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1086868290083088,"score_gpt":0.2030623659292932,"score_spread":0.09437553692098442,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}