{"id":"W4393146382","doi":"10.1609/aaai.v38i20.30613","title":"Reward-Respecting Subtasks for Model-Based Reinforcement Learning (Abstract Reprint)","year":2024,"lang":"en","type":"article","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta; Canadian Institute for Advanced Research","funders":"","keywords":"Reprint; Reinforcement learning; Reinforcement; Psychology; Computer science; Artificial intelligence; Social psychology; Physics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.001378826,0.0003082926,0.0002875824,0.0002417529,0.0003679286,0.000845509,0.0020164,0.0001231203,0.00004520314],"category_scores_gemma":[0.001263883,0.0002486265,0.0002616786,0.0006596146,0.0001687886,0.0005421879,0.0003937554,0.0006740689,0.00008157375],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001631186,"about_ca_system_score_gemma":0.0002966257,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00001739594,"about_ca_topic_score_gemma":0.000001297364,"domain_scores_codex":[0.9971296,0.00001316636,0.0008531112,0.0007581372,0.000713456,0.000532511],"domain_scores_gemma":[0.9980313,0.0003416674,0.0004312273,0.0004283061,0.0006648751,0.0001025819],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00003265151,0.00001953699,0.00002456044,0.0001211999,0.00001650671,4.578669e-7,0.0007804049,0.5530468,0.01056802,0.4196101,0.00009035451,0.01568943],"study_design_scores_gemma":[0.00002473746,0.0001936874,0.00001034248,0.0005155158,0.00001532122,0.000002129093,0.0001834357,0.7680879,0.2021447,0.02838434,0.0002230085,0.0002149316],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.008410074,0.00002227482,0.9749536,0.0024697,0.0005986922,0.0007052143,0.000001049757,0.000387306,0.01245209],"genre_scores_gemma":[0.9834925,0.00001604957,0.01485545,0.000141357,0.00009187429,0.00007202678,0.0000011894,0.0000301251,0.001299434],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9750824,"threshold_uncertainty_score":0.9999966,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1002086969293765,"score_gpt":0.3268577768747262,"score_spread":0.2266490799453497,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}