{"id":"W2407441816","doi":"","title":"Reinforcement Learning with Limited Reinforcement: Using Bayes Risk for Active Learning in POMDPs.","year":2008,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":8,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"","keywords":"Partially observable Markov decision process; Reinforcement learning; Computer science; Planner; Markov decision process; Artificial intelligence; Automated planning and scheduling; Machine learning; Bayesian probability; Domain (mathematical analysis); Markov process; Markov chain; Markov model; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005747107,0.001403736,0.00228104,0.0008061657,0.0006158354,0.001523822,0.002423354,0.001822205,0.002492596],"category_scores_gemma":[0.02146722,0.001000606,0.0008634346,0.0006633843,0.002275667,0.003379414,0.00249602,0.002948019,0.0003561621],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002040335,"about_ca_system_score_gemma":0.001923329,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00689328,"about_ca_topic_score_gemma":0.005184573,"domain_scores_codex":[0.997575,0.001456012,0.0001044676,0.0002903835,0.0004138324,0.0001603996],"domain_scores_gemma":[0.9863737,0.01154162,0.0006854648,0.0004115669,0.0005886202,0.0003990421],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001518186,0.00008286697,0.001144993,0.0001079348,0.00006989268,0.00007344058,0.0001124739,0.9265752,0.0002396434,0.03523748,0.0007359002,0.0354684],"study_design_scores_gemma":[0.00001300478,0.0000140133,0.0000276297,0.000008779022,0.000005397206,0.000004270018,0.000003508815,0.9853579,0.00006578336,0.01438778,0.0001087092,0.000003193506],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01009251,0.0005847075,0.987089,0.0003413231,0.00004404811,0.0000623784,0.00003689248,0.0002569545,0.001492099],"genre_scores_gemma":[0.7824432,0.0005087792,0.2140591,0.0002452144,0.0001082482,0.0004280861,0.0001341028,0.000122199,0.001951065],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.00689328,"threshold_uncertainty_score":0.03039396,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02959896535382437,"score_gpt":0.2529070386760443,"score_spread":0.2233080733222199,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}