{"id":"W7124143215","doi":"10.65109/vuye5463","title":"Optimal policy switching algorithms for reinforcement learning","year":2010,"lang":"","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"","keywords":"Reinforcement learning; Task (project management); Q-learning; Function (biology); Markov decision process; Function approximation; Control (management); Optimal control","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002091056,0.001211004,0.001486947,0.0007998339,0.0004457318,0.001009639,0.001578365,0.001479104,0.004810024],"category_scores_gemma":[0.007127831,0.0005750484,0.0005777882,0.0007205417,0.001427108,0.001328008,0.001418475,0.0025238,0.0006818183],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001482917,"about_ca_system_score_gemma":0.001502587,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003260044,"about_ca_topic_score_gemma":0.002429894,"domain_scores_codex":[0.9990701,0.0004051083,0.00005330212,0.0001555213,0.0002162695,0.00009967136],"domain_scores_gemma":[0.9972278,0.00216382,0.0001720077,0.000110706,0.0002250084,0.0001005739],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.00008144767,0.0000903973,0.0003135322,0.00008484343,0.00003911622,0.00002920543,0.00006496869,0.8759821,0.0004127384,0.05966395,0.001625941,0.06161174],"study_design_scores_gemma":[0.00001980194,0.00001644716,0.00002102479,0.000006724324,0.000003633962,0.000004232908,0.000003476613,0.9759285,0.0001107288,0.02351538,0.0003663653,0.00000361763],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.005327433,0.0003838105,0.9912642,0.0001802456,0.00004710267,0.00006092341,0.00002869454,0.0003251101,0.002382463],"genre_scores_gemma":[0.5952932,0.0007871808,0.397143,0.0003502849,0.0001253456,0.0008193794,0.0002239855,0.0002089798,0.005048655],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.004810024,"threshold_uncertainty_score":0.01609117,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02392354187161438,"score_gpt":0.3013734190586969,"score_spread":0.2774498771870825,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}