{"id":"W4295683034","doi":"10.1016/j.neunet.2025.108521","title":"Multi-step first: A lightweight deep reinforcement learning strategy for robust continuous control with partial observability","year":2025,"lang":"en","type":"preprint","venue":"Neural Networks","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"Social Sciences and Humanities Research Council of Canada; Australian Research Council; Alliance de recherche numérique du Canada","keywords":"Observability; Robot; Computer science; State space; Robustness (evolution); Control theory (sociology); Reinforcement learning; Control (management); Control engineering; Artificial intelligence; Engineering; Mathematics","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","research_integrity"],"consensus_categories":[],"category_scores_codex":[0.0007328078,0.0009199518,0.001170616,0.0001409155,0.0006220332,0.0009403568,0.002302142,0.0007203566,0.00002715076],"category_scores_gemma":[0.0002027173,0.00079655,0.0004438017,0.000356934,0.0001554013,0.0003753254,0.001432566,0.002339705,0.000005393163],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002689924,"about_ca_system_score_gemma":0.0002457496,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001280911,"about_ca_topic_score_gemma":0.0001619552,"domain_scores_codex":[0.9948481,0.0003255986,0.001207089,0.001640048,0.0006592483,0.001319967],"domain_scores_gemma":[0.9955852,0.0008813626,0.001007044,0.001707317,0.0005316913,0.0002873722],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002328158,0.00005494442,0.00418643,0.0002790566,0.0002271252,0.00002468535,0.0001910768,0.9892913,9.169507e-7,0.0006298789,0.0003573725,0.004524454],"study_design_scores_gemma":[0.002976884,0.0008143194,0.0006369631,0.0003172653,0.0001684714,0.000006431632,0.00002287929,0.9910403,0.00001019325,0.00001679014,0.00317972,0.0008097091],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0004921224,0.0003544859,0.9923162,0.0006305345,0.001925178,0.003258434,0.000004375413,0.0006591094,0.0003595147],"genre_scores_gemma":[0.9000752,0.00007405749,0.09441289,0.0006375952,0.0006735087,0.000916925,0.0001750414,0.00006695401,0.002967865],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.899583,"threshold_uncertainty_score":0.9999619,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03587578380555461,"score_gpt":0.2609447892771726,"score_spread":0.225069005471618,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}