{"id":"W2760195126","doi":"10.1613/jair.1.11478","title":"On Overfitting and Asymptotic Bias in Batch Reinforcement Learning with Partial Observability","year":2019,"lang":"en","type":"preprint","venue":"Journal of Artificial Intelligence Research","topic":"Smart Grid Energy Management","field":"Engineering","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"Natural Sciences and Engineering Research Council of Canada; Samsung; Institut de Valorisation des Données; Waalse Gewest","keywords":"Overfitting; Observability; Reinforcement learning; Observable; Context (archaeology); Representation (politics); Computer science; Partially observable Markov decision process; Mathematics; Artificial intelligence; Mathematical optimization; Machine learning; Applied mathematics; Artificial neural network; Markov chain","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","research_integrity"],"consensus_categories":[],"category_scores_codex":[0.00624518,0.0002920459,0.000544154,0.0007931626,0.00008957107,0.0002635422,0.0004735141,0.0002133288,0.0000891049],"category_scores_gemma":[0.001058336,0.0002508067,0.000101616,0.0004791043,0.0001447206,0.0001693024,0.0004851137,0.003550894,0.00003879971],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006913983,"about_ca_system_score_gemma":0.0002066082,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0002029948,"about_ca_topic_score_gemma":0.00009668822,"domain_scores_codex":[0.9959942,0.0003975462,0.001141488,0.000367938,0.001437755,0.0006610344],"domain_scores_gemma":[0.9978883,0.0008967522,0.0002336598,0.0004211747,0.0003881224,0.0001719359],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002996104,0.00005937633,0.003769159,0.0003609967,0.0000926962,0.0000741755,0.0006747043,0.9800377,0.0001598559,0.001152702,0.00006447169,0.01325452],"study_design_scores_gemma":[0.000107021,0.00114448,0.002263904,0.001698064,0.00002320122,0.000009981639,0.001379863,0.9800684,0.00862598,0.003841248,0.000486025,0.0003517588],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9687118,0.000206063,0.02827649,0.0002232813,0.0009309433,0.0004348343,7.054676e-7,0.00003216116,0.001183734],"genre_scores_gemma":[0.998395,0.0005529851,0.00052628,0.000009959233,0.0003792295,0.00001732849,0.000002423935,0.00004857258,0.00006821288],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02968322,"threshold_uncertainty_score":0.9999944,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1779517620425629,"score_gpt":0.3636504415212668,"score_spread":0.1856986794787039,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}