{"id":"W2157864803","doi":"","title":"Action-Gap Phenomenon in Reinforcement Learning","year":2011,"lang":"en","type":"article","venue":"PolyPublie (École Polytechnique de Montréal)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":41,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"","keywords":"Reinforcement learning; Action (physics); Phenomenon; Bounded function; Q-learning; Bellman equation; Function (biology); Value (mathematics); Mathematics; Reinforcement; Computer science; Mathematical optimization; Artificial intelligence; Statistics; Mathematical analysis; Physics; Engineering; Structural engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005384113,0.0007496282,0.001213655,0.0005244869,0.0005708884,0.001363353,0.001022339,0.001467743,0.002212403],"category_scores_gemma":[0.03425872,0.0004170738,0.0006995895,0.0003822427,0.004385935,0.003220579,0.002333862,0.003270903,0.0002768243],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001315786,"about_ca_system_score_gemma":0.000895878,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001179298,"about_ca_topic_score_gemma":0.0005295299,"domain_scores_codex":[0.9975913,0.001184504,0.0000941019,0.0003767658,0.0005199178,0.0002334577],"domain_scores_gemma":[0.9735978,0.02145893,0.001843798,0.001740908,0.0007595054,0.000599084],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0005757967,0.0001138036,0.004919366,0.0003421797,0.0001090735,0.0003598347,0.0004881518,0.5558712,0.005077353,0.4025677,0.001545272,0.02803045],"study_design_scores_gemma":[0.00003943247,0.0002228537,0.0006645427,0.00002936034,0.00001292716,0.00007078761,0.00003207543,0.8819094,0.001219856,0.1149678,0.0008145965,0.00001642366],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.07830811,0.00084044,0.9123435,0.001039581,0.00007547034,0.00006788461,0.00006209844,0.0004432687,0.00681966],"genre_scores_gemma":[0.9538204,0.0002835979,0.04376435,0.0001827694,0.00006965299,0.0001134567,0.00004648983,0.00009510979,0.001624206],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.005384113,"threshold_uncertainty_score":0.02847427,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03411165688407607,"score_gpt":0.2483852345278482,"score_spread":0.2142735776437722,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}