{"id":"W2966675798","doi":"10.24963/ijcai.2019/506","title":"Planning with Expectation Models","year":2019,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":5,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Reinforcement learning; Computer science; Convergence (economics); Parametrization (atmospheric modeling); Mathematical optimization; Bellman equation; Function (biology); State (computer science); Artificial intelligence; Mathematics; Algorithm","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001951387,0.00120269,0.00124582,0.0005430862,0.0004415317,0.001692078,0.001913827,0.001464013,0.004888954],"category_scores_gemma":[0.01019562,0.0006739689,0.001181671,0.0007982532,0.001506358,0.003436753,0.002008831,0.002724608,0.0007571414],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001368809,"about_ca_system_score_gemma":0.001636318,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004670295,"about_ca_topic_score_gemma":0.004702372,"domain_scores_codex":[0.998125,0.0008385746,0.0001056138,0.0003750243,0.0003932035,0.0001624385],"domain_scores_gemma":[0.9957362,0.003262131,0.0002934076,0.0003185079,0.0002670992,0.0001225391],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001042232,0.00004965474,0.0004758958,0.0001136984,0.00003911852,0.00009930442,0.0001148642,0.7760279,0.0005929056,0.1875564,0.001426262,0.03339976],"study_design_scores_gemma":[0.00001631249,0.00003076123,0.00004785111,0.00001342803,0.000008561177,0.0000253239,0.000009472781,0.916645,0.0003132658,0.08195473,0.0009256981,0.000009521326],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.003207163,0.000131134,0.9943671,0.0002086692,0.00001685773,0.000025008,0.00005867834,0.0002262268,0.00175914],"genre_scores_gemma":[0.6222598,0.0006937936,0.3688704,0.0004113013,0.00008992745,0.0004643885,0.0004828216,0.0002139374,0.006513711],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.004888954,"threshold_uncertainty_score":0.01635516,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01667274162100398,"score_gpt":0.2247960668066918,"score_spread":0.2081233251856878,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}