{"id":"W1507852408","doi":"10.48550/arxiv.1206.3281","title":"Model-Based Bayesian Reinforcement Learning in Large Structured Domains","year":2012,"lang":"en","type":"preprint","venue":"PubMed","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":51,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"National Institute of Mental Health","keywords":"Reinforcement learning; Computer science; Scalability; Artificial intelligence; Bayesian probability; Machine learning; Bayesian inference","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002022441,0.0007556821,0.001448432,0.0005090844,0.0004478139,0.00100008,0.001276418,0.001321542,0.001981316],"category_scores_gemma":[0.01027262,0.0007143003,0.0006114817,0.0005699986,0.001894203,0.002367113,0.001707412,0.002143251,0.0002295194],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001388587,"about_ca_system_score_gemma":0.001212776,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006967803,"about_ca_topic_score_gemma":0.006428736,"domain_scores_codex":[0.9991191,0.0004477443,0.00003440956,0.000146776,0.0001722846,0.00007964257],"domain_scores_gemma":[0.9958785,0.00313521,0.0003134694,0.0002495285,0.0002384954,0.0001848547],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00004375322,0.00002547329,0.000274397,0.00004572865,0.00002102949,0.00005019159,0.0000515079,0.9386036,0.0003706558,0.04780871,0.000444561,0.01226038],"study_design_scores_gemma":[0.00001103851,0.00000918371,0.0000346612,0.000004378532,0.000002310059,0.000005545952,0.00000389704,0.9613546,0.00008037673,0.03833459,0.0001561456,0.000003250936],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01856552,0.0002714175,0.9790264,0.0003674462,0.00001923164,0.00002488526,0.00004138932,0.0002036527,0.001479944],"genre_scores_gemma":[0.8434151,0.0004961934,0.153337,0.0001520397,0.00005996813,0.0001678433,0.0001367576,0.0000752232,0.002160009],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006967803,"threshold_uncertainty_score":0.0138545,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02538073376749116,"score_gpt":0.2424280285234937,"score_spread":0.2170472947560025,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}