{"id":"W2949600864","doi":"","title":"Model-Based Bayesian Reinforcement Learning in Large Structured Domains","year":2012,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"","keywords":"Reinforcement learning; Computer science; Scalability; Artificial intelligence; Bayesian probability; Machine learning; Bayesian inference","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0006096997,0.0005216278,0.0004862426,0.0006109623,0.0002399715,0.0001779872,0.002291351,0.0004858457,0.00007163067],"category_scores_gemma":[0.00006445932,0.000628706,0.0002480048,0.0007134152,0.00008010686,0.0005480705,0.002338841,0.001668513,0.00006118551],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007139545,"about_ca_system_score_gemma":0.0004424803,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00005669545,"about_ca_topic_score_gemma":0.00004835963,"domain_scores_codex":[0.9969987,0.0002362528,0.000431868,0.001083693,0.0002642948,0.0009852297],"domain_scores_gemma":[0.9974416,0.00009635901,0.0005021709,0.001555876,0.0001194681,0.0002844531],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00002068125,0.00003355676,0.009900982,0.00007998595,0.00003746552,0.00008286995,0.0004127862,0.9136928,0.00001612559,0.07561042,0.00003209715,0.00008016917],"study_design_scores_gemma":[0.001108272,0.00004498566,0.0009999392,0.0001151395,0.00004076765,0.000001121249,0.00004162065,0.9941511,0.00005392787,0.002506132,0.0002977335,0.0006392333],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01793756,0.00002593194,0.9765015,0.00006302251,0.0004950318,0.0004655608,0.00000257514,0.0003855417,0.004123276],"genre_scores_gemma":[0.9869469,0.00003157129,0.01029741,0.0001750825,0.00006019528,0.000002272233,0.00006118124,0.00003822207,0.002387093],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9690094,"threshold_uncertainty_score":0.9996164,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04617089644699002,"score_gpt":0.2011105485737758,"score_spread":0.1549396521267858,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}