{"id":"W7124153011","doi":"10.65109/actd7997","title":"Escaping local optima in POMDP planning as inference","year":2011,"lang":"","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"","keywords":"Partially observable Markov decision process; Inference; Reinforcement learning; Controller (irrigation); Greedy algorithm; Local planning; Control (management)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","insufficient_payload"],"consensus_categories":["insufficient_payload"],"category_scores_codex":[0.0008544808,0.0004705765,0.0004534701,0.0004738579,0.0002020921,0.0004262489,0.00215204,0.000274041,0.001645611],"category_scores_gemma":[0.0003054312,0.0004943494,0.0001100154,0.001018118,0.0002842077,0.001536148,0.001480302,0.0009160186,0.001654498],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002062723,"about_ca_system_score_gemma":0.000427199,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0007854847,"about_ca_topic_score_gemma":0.00001132232,"domain_scores_codex":[0.9960026,0.0001901962,0.001000671,0.0009186116,0.0007092562,0.001178622],"domain_scores_gemma":[0.9979265,0.0002671294,0.0003115175,0.001053157,0.000141833,0.000299813],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00002382197,0.00006633281,0.01410722,0.00003881788,0.00002395723,0.0002298651,0.01416477,0.8996549,0.00001998913,0.0481858,0.000062208,0.02342239],"study_design_scores_gemma":[0.0005715272,0.000506232,0.01030885,0.0005069008,0.00000970447,0.00003010755,0.0008844954,0.9846951,0.0008028223,0.0008267689,0.0002366802,0.0006207919],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.004558927,0.00017302,0.8062892,0.00007782919,0.0007777359,0.0002423468,1.351147e-7,0.0001518594,0.1877289],"genre_scores_gemma":[0.9057856,0.00004662232,0.09102084,0.0005682568,0.00005630322,0.000008603432,0.000001132894,0.00002564453,0.002486969],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9012267,"threshold_uncertainty_score":0.9997508,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.08219326181887587,"score_gpt":0.305530048721098,"score_spread":0.2233367869022221,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}