{"id":"W3041828093","doi":"10.24963/ijcai.2020/706","title":"On Overfitting and Asymptotic Bias in Batch Reinforcement Learning with Partial Observability (Extended Abstract)","year":2020,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université de Montréal; McGill University","funders":"Natural Sciences and Engineering Research Council of Canada; Samsung; Institut de Valorisation des Données; Waalse Gewest","keywords":"Overfitting; Observability; Reinforcement learning; Term (time); Context (archaeology); Representation (politics); Computer science; Artificial intelligence; State (computer science); Mathematics; Applied mathematics; Algorithm; Artificial neural network","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01063503,0.0009945376,0.00171911,0.0007206368,0.0004299085,0.001472497,0.001356987,0.001494208,0.002073617],"category_scores_gemma":[0.07398006,0.0005967555,0.0008362221,0.0007432696,0.004393765,0.003087281,0.002988389,0.002794777,0.0001860811],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002365401,"about_ca_system_score_gemma":0.00161718,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004272229,"about_ca_topic_score_gemma":0.002491111,"domain_scores_codex":[0.995868,0.001992504,0.0001959381,0.000523682,0.001062278,0.0003576793],"domain_scores_gemma":[0.9282853,0.06326585,0.003166557,0.002080424,0.002592102,0.0006098261],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003016024,0.0001160113,0.002932515,0.000265845,0.0001759224,0.0002272222,0.0002390253,0.8355539,0.002679949,0.1174287,0.00132302,0.03875636],"study_design_scores_gemma":[0.00003280029,0.000105221,0.0006378588,0.00004911811,0.0000282986,0.00004594863,0.00001738704,0.8926876,0.0006583194,0.1054572,0.0002595676,0.00002056856],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0520052,0.0008308021,0.9414865,0.001482827,0.00006227326,0.00003895389,0.00004460744,0.0002749407,0.003774004],"genre_scores_gemma":[0.9309776,0.0007963114,0.06468233,0.0007389377,0.0001860028,0.0001525542,0.00006779564,0.0001711807,0.002227392],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01063503,"threshold_uncertainty_score":0.05624408,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04988424548801556,"score_gpt":0.2554322823185893,"score_spread":0.2055480368305737,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}