{"id":"W4295683034","doi":"10.1016/j.neunet.2025.108521","title":"Multi-step first: A lightweight deep reinforcement learning strategy for robust continuous control with partial observability","year":2025,"lang":"en","type":"preprint","venue":"Neural Networks","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"Social Sciences and Humanities Research Council of Canada; Australian Research Council; Alliance de recherche numérique du Canada","keywords":"Observability; Robot; Computer science; State space; Robustness (evolution); Control theory (sociology); Reinforcement learning; Control (management); Control engineering; Artificial intelligence; Engineering; Mathematics","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001495173,0.001018823,0.00106881,0.000379486,0.0003655278,0.0006777194,0.00143833,0.0009500161,0.002253422],"category_scores_gemma":[0.003235193,0.0004709844,0.0005787591,0.0002802051,0.001096326,0.001032063,0.001799296,0.001710413,0.0003346344],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009099061,"about_ca_system_score_gemma":0.001449084,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00374157,"about_ca_topic_score_gemma":0.004021374,"domain_scores_codex":[0.9995234,0.0001265369,0.00002222407,0.0001009303,0.0001490189,0.00007775176],"domain_scores_gemma":[0.9987884,0.0006549467,0.0001450546,0.000124638,0.0001730848,0.0001138385],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001450745,0.00006281915,0.0005313538,0.00008187991,0.00004708132,0.000109558,0.00007732047,0.9224041,0.002703776,0.01380502,0.001168123,0.05886402],"study_design_scores_gemma":[0.000006462976,0.00003012828,0.00002862869,0.00000335101,0.000002807794,0.000007244315,0.000001938874,0.9973831,0.0003040467,0.002100287,0.0001291712,0.000002852821],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.01489179,0.0001577635,0.9824765,0.0001630213,0.00003177047,0.00003326717,0.00002455846,0.0005871137,0.001634203],"genre_scores_gemma":[0.896295,0.0001008037,0.1009341,0.0001804331,0.00002385175,0.0001093903,0.00006224258,0.000090334,0.002203986],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.00374157,"threshold_uncertainty_score":0.007907271,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03587578380555461,"score_gpt":0.2609447892771726,"score_spread":0.225069005471618,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}