{"id":"W7124176698","doi":"10.65109/anfh7318","title":"Incremental Policy Iteration with Guaranteed Escape from Local Optima in POMDP Planning","year":2015,"lang":"","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"","keywords":"Partially observable Markov decision process; Bounded function; Controller (irrigation); Markov decision process; Scale (ratio); Energy consumption; Property (philosophy); Local search (optimization)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0006830819,0.0004905369,0.0004546456,0.0005732458,0.0001585973,0.001034888,0.001099977,0.0002043505,0.0001309103],"category_scores_gemma":[0.0001082861,0.0004472581,0.00006178227,0.001251584,0.0002072921,0.001697749,0.000652698,0.000565993,0.0002797761],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007466091,"about_ca_system_score_gemma":0.0008855658,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004679031,"about_ca_topic_score_gemma":0.00009694521,"domain_scores_codex":[0.9959673,0.000250959,0.0008794828,0.0008498399,0.001205747,0.0008467016],"domain_scores_gemma":[0.9982415,0.0001223004,0.000325125,0.0007727516,0.0001850261,0.0003532355],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002103936,0.00008189218,0.02132821,0.00001047998,0.00004921723,0.0001184378,0.009774159,0.9603993,0.0001560343,0.003333411,0.0003912985,0.004147165],"study_design_scores_gemma":[0.003485073,0.001061152,0.003877513,0.0003334992,0.0000171765,0.00003308674,0.001510931,0.9876578,0.0008588788,0.0001240001,0.0004725133,0.0005683478],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.06836186,0.0001289394,0.9145938,0.001053625,0.0004111154,0.0004372797,0.00000314685,0.0001312391,0.01487901],"genre_scores_gemma":[0.9238613,0.000004835287,0.07385308,0.001215439,0.0003043482,0.00001030393,0.00003374663,0.00003341493,0.000683505],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.8554995,"threshold_uncertainty_score":0.9997979,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0358786020138582,"score_gpt":0.2825570468465597,"score_spread":0.2466784448327015,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}