{"id":"W4200140111","doi":"10.1109/iros51168.2021.9636140","title":"Memory-based Deep Reinforcement Learning for POMDPs","year":2021,"lang":"en","type":"article","venue":"2021 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":77,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"Compute Canada","keywords":"Reinforcement learning; Markov decision process; Computer science; Observable; Artificial intelligence; Partially observable Markov decision process; Noise (video); Robotics; Component (thermodynamics); Sensitivity (control systems); Feature (linguistics); Deep learning; Markov process; Markov chain; Machine learning; Robot; Markov model","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001085576,0.0009095628,0.001161859,0.0003555922,0.0003467927,0.0006421455,0.001322301,0.0008796183,0.002453068],"category_scores_gemma":[0.003735197,0.0005055127,0.0004843209,0.0003495932,0.0008227563,0.0009625013,0.001192551,0.00180872,0.0002712462],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001351199,"about_ca_system_score_gemma":0.001700194,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.009951817,"about_ca_topic_score_gemma":0.00954276,"domain_scores_codex":[0.9996376,0.00009724244,0.00002546719,0.00008233167,0.00008400212,0.00007325818],"domain_scores_gemma":[0.9983686,0.001097125,0.0001518042,0.00009766298,0.0001996056,0.00008525095],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00005079453,0.00003341674,0.0004326211,0.00005189307,0.0000197259,0.00003233685,0.00002883628,0.9695182,0.0004880858,0.003692927,0.0004396223,0.02521153],"study_design_scores_gemma":[0.00000389851,0.000008045963,0.00001667568,0.000001940615,0.000001371256,0.000002059329,0.000001501262,0.9984201,0.0001102496,0.001377402,0.00005550931,0.000001110462],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.0355684,0.0004211769,0.9604839,0.0002783127,0.00006067501,0.00005003944,0.0001047496,0.001034386,0.001998362],"genre_scores_gemma":[0.9218271,0.0001588911,0.07602295,0.0001568625,0.00002236306,0.0001317829,0.0001598444,0.0000693151,0.001450848],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.009951817,"threshold_uncertainty_score":0.01978779,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06087323939367912,"score_gpt":0.3000001409251943,"score_spread":0.2391269015315152,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}