{"id":"W2760195126","doi":"10.1613/jair.1.11478","title":"On Overfitting and Asymptotic Bias in Batch Reinforcement Learning with Partial Observability","year":2019,"lang":"en","type":"preprint","venue":"Journal of Artificial Intelligence Research","topic":"Smart Grid Energy Management","field":"Engineering","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"Natural Sciences and Engineering Research Council of Canada; Samsung; Institut de Valorisation des Données; Waalse Gewest","keywords":"Overfitting; Observability; Reinforcement learning; Observable; Context (archaeology); Representation (politics); Computer science; Partially observable Markov decision process; Mathematics; Artificial intelligence; Mathematical optimization; Machine learning; Applied mathematics; Artificial neural network; Markov chain","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02382284,0.001816053,0.002813473,0.001269107,0.0008540358,0.002413011,0.002560998,0.002791767,0.002197294],"category_scores_gemma":[0.1647875,0.001075396,0.00125449,0.001037331,0.005946699,0.005498552,0.004416985,0.005262859,0.0002799522],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003802431,"about_ca_system_score_gemma":0.002276154,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004730632,"about_ca_topic_score_gemma":0.003180675,"domain_scores_codex":[0.9910678,0.004626104,0.0004421696,0.001274773,0.001960056,0.0006290739],"domain_scores_gemma":[0.8356107,0.1470453,0.005741118,0.005701017,0.004677089,0.001224712],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000349365,0.0001220151,0.004518362,0.0002787921,0.0001674816,0.0002344108,0.0002439693,0.8904447,0.001458632,0.07706246,0.0008180702,0.02430166],"study_design_scores_gemma":[0.00003526324,0.0001103705,0.0005967239,0.00006481957,0.00002811721,0.00006083356,0.00002261618,0.9293181,0.0005838568,0.06891898,0.0002374978,0.0000227836],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.04021974,0.001232352,0.9535852,0.001656009,0.00006628797,0.00007012865,0.00006668165,0.0004012373,0.002702342],"genre_scores_gemma":[0.8940457,0.001089695,0.09997935,0.001234519,0.0002885227,0.0002895497,0.0002003874,0.0003690518,0.002503191],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.02382284,"threshold_uncertainty_score":0.1259887,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1779517620425629,"score_gpt":0.3636504415212668,"score_spread":0.1856986794787039,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}