{"id":"W2184461682","doi":"10.82308/33420","title":"A Bayesian Framework for Online Parameter Learning in POMDPs","year":2011,"lang":"en","type":"article","venue":"eScholarship@McGill (McGill)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"","keywords":"Partially observable Markov decision process; Computer science; Reinforcement learning; Artificial intelligence; Markov decision process; Machine learning; Ambiguity; Robotics; Bayesian probability; Robot; Markov process; Markov chain; Markov model","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004289894,0.002252196,0.002400399,0.001496281,0.001094796,0.003221505,0.003876127,0.00238694,0.006098707],"category_scores_gemma":[0.01112027,0.001849384,0.0022842,0.001532353,0.002885019,0.004054403,0.002654979,0.004754013,0.001121494],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00347814,"about_ca_system_score_gemma":0.003624255,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01938857,"about_ca_topic_score_gemma":0.01722319,"domain_scores_codex":[0.9974655,0.001004559,0.0001650683,0.0004162595,0.0007288316,0.0002198853],"domain_scores_gemma":[0.9960342,0.002782098,0.0003298454,0.0001772812,0.0005012768,0.0001752736],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00003786779,0.00003272674,0.000256625,0.0001004884,0.00004044961,0.00007511242,0.0001025593,0.8162293,0.000280553,0.1648138,0.0009240893,0.01710636],"study_design_scores_gemma":[0.00001942763,0.00002152947,0.00004680283,0.00002478436,0.00001059417,0.000013545,0.00001245115,0.9239756,0.0001037529,0.07398934,0.001765957,0.000016314],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.0009668123,0.0003039652,0.9963543,0.0001880082,0.00003092035,0.00003810391,0.00007607148,0.0001681284,0.001873809],"genre_scores_gemma":[0.3182701,0.002300983,0.6688927,0.0003457954,0.0003082248,0.001040315,0.0007054642,0.000291375,0.007845054],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01938857,"threshold_uncertainty_score":0.03855139,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04305426771065417,"score_gpt":0.2616776303496849,"score_spread":0.2186233626390308,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}