{"id":"W7124176698","doi":"10.65109/anfh7318","title":"Incremental Policy Iteration with Guaranteed Escape from Local Optima in POMDP Planning","year":2015,"lang":"","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"","keywords":"Partially observable Markov decision process; Bounded function; Controller (irrigation); Markov decision process; Scale (ratio); Energy consumption; Property (philosophy); Local search (optimization)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002440232,0.001353438,0.001921737,0.0007522205,0.0006330783,0.001079736,0.00160867,0.001479202,0.00266202],"category_scores_gemma":[0.008205039,0.0008849027,0.000975041,0.0005799413,0.002416921,0.001458824,0.002334789,0.002500103,0.0003757388],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001377397,"about_ca_system_score_gemma":0.002525581,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005880076,"about_ca_topic_score_gemma":0.005630396,"domain_scores_codex":[0.9986522,0.0005818142,0.00006692737,0.0002318074,0.0002989713,0.000168468],"domain_scores_gemma":[0.9939627,0.005016821,0.0003323937,0.0002264604,0.0002563988,0.0002052053],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00007245771,0.0000414377,0.000257105,0.00006832103,0.00002922234,0.00006214155,0.00007974682,0.9715612,0.0003267303,0.01479832,0.000485513,0.01221783],"study_design_scores_gemma":[0.00001730726,0.00002432995,0.00002540165,0.000007295144,0.000004912336,0.00000772262,0.000006324346,0.9906596,0.0001629065,0.008889052,0.0001906513,0.000004495373],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02127046,0.0003144142,0.9727011,0.0002795967,0.00003618887,0.00008397154,0.00004613673,0.0007325654,0.004535546],"genre_scores_gemma":[0.7932658,0.0002676878,0.2024784,0.0002393482,0.00004094448,0.0005012015,0.0001346331,0.0002083147,0.002863563],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.005880076,"threshold_uncertainty_score":0.0129053,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0358786020138582,"score_gpt":0.2825570468465597,"score_spread":0.2466784448327015,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}