{"id":"W183139520","doi":"","title":"Stochastic local search for POMDP controllers","year":2004,"lang":"en","type":"article","venue":"TSpace","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":44,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Partially observable Markov decision process; Heuristics; Computer science; Markov decision process; Mathematical optimization; Dynamic programming; Observable; Controller (irrigation); State (computer science); Markov process; Markov chain; Mathematics; Algorithm; Machine learning; Markov model","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001529095,0.0008244778,0.00123905,0.0006956168,0.0004982582,0.0008594994,0.0009729647,0.0009312136,0.003243274],"category_scores_gemma":[0.004651055,0.0005864869,0.0005787627,0.0005439913,0.00145986,0.0009590815,0.001172985,0.001268702,0.0004207282],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001216993,"about_ca_system_score_gemma":0.001430584,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00326195,"about_ca_topic_score_gemma":0.002956087,"domain_scores_codex":[0.9994028,0.0002508289,0.00002859216,0.000107441,0.0001562101,0.00005420542],"domain_scores_gemma":[0.9976923,0.001801373,0.0001688359,0.00008516412,0.0001594943,0.000092765],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00002751941,0.00001618645,0.0001190862,0.00005871574,0.00001736984,0.00002618963,0.00002648581,0.9756768,0.000386722,0.01322123,0.0003982317,0.01002543],"study_design_scores_gemma":[0.00001230267,0.00001294522,0.00001499922,0.000004546548,0.00000255947,0.000003369588,0.000004264225,0.9943032,0.0001384242,0.005305018,0.0001963281,0.000002061405],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01309452,0.0002726179,0.9831315,0.000145739,0.00002180584,0.00004628544,0.00003397695,0.0004778602,0.002775716],"genre_scores_gemma":[0.7484934,0.0003308916,0.2470404,0.0001500503,0.00004189019,0.0004676403,0.0001367936,0.0001555582,0.003183521],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.00326195,"threshold_uncertainty_score":0.01084983,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02851222499342767,"score_gpt":0.3227567584077197,"score_spread":0.294244533414292,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}