{"id":"W4404535976","doi":"10.3390/e26110995","title":"Information-Theoretic Generalization Bounds for Batch Reinforcement Learning","year":2024,"lang":"en","type":"article","venue":"Entropy","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Simon Fraser University","funders":"","keywords":"Generalization; Reinforcement learning; Computer science; Information theory; Generalization error; Artificial intelligence; Prior information; Machine learning; Mathematics; Mathematical optimization; Unsupervised learning; Statistics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01167116,0.002239431,0.002302275,0.001699644,0.001003302,0.002339642,0.003815342,0.002290287,0.005145691],"category_scores_gemma":[0.05326865,0.0008622993,0.002098409,0.001548141,0.004712112,0.008203965,0.005910766,0.007495228,0.0008083101],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.004961798,"about_ca_system_score_gemma":0.001799872,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002820002,"about_ca_topic_score_gemma":0.002095731,"domain_scores_codex":[0.9944312,0.001869398,0.0003193513,0.001076001,0.001679727,0.000624302],"domain_scores_gemma":[0.9458694,0.04249013,0.003137453,0.004291386,0.003022615,0.001189014],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002278996,0.0001205903,0.001274462,0.0003362287,0.0001794564,0.0001418142,0.0002848505,0.5487391,0.003575069,0.40768,0.002847396,0.03459313],"study_design_scores_gemma":[0.000008513674,0.00005504456,0.0002460256,0.00003465887,0.00002142936,0.00003664605,0.00001336373,0.832119,0.0007906237,0.1661476,0.0005056156,0.00002146445],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01497498,0.0009377733,0.9767901,0.001008632,0.0000824665,0.00006638222,0.0001321571,0.0002725027,0.005734933],"genre_scores_gemma":[0.8397178,0.001999858,0.1487682,0.001075062,0.0005775914,0.0006360093,0.0004473779,0.0004936172,0.006284371],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01167116,"threshold_uncertainty_score":0.06172371,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.008531388615068268,"score_gpt":0.2457592315626977,"score_spread":0.2372278429476294,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}