{"id":"W3176342773","doi":"","title":"OptiDICE: Offline Policy Optimization via Stationary Distribution Correction Estimation","year":2021,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"","keywords":"Hyperparameter; Reinforcement learning; Benchmark (surveying); Computer science; Bootstrapping (finance); Set (abstract data type); Mathematical optimization; Online and offline; Offline learning; Artificial intelligence; Machine learning; Mathematics; Online learning; Econometrics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0002402731,0.0002934709,0.0002516228,0.0003009067,0.0002677479,0.00028753,0.0007645037,0.000313359,0.00003886759],"category_scores_gemma":[0.0002197319,0.0003914194,0.0001397656,0.001198011,0.00006584686,0.001061832,0.001014574,0.000534193,0.00003615371],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000931338,"about_ca_system_score_gemma":0.0005667425,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000224941,"about_ca_topic_score_gemma":0.000006203732,"domain_scores_codex":[0.9981261,0.0002002174,0.0003227757,0.0008564479,0.0002008549,0.0002936223],"domain_scores_gemma":[0.997866,0.0001080264,0.0005183455,0.0008704414,0.0005092291,0.0001279252],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00001192711,0.00004797508,0.0002094188,0.00004687378,0.00004367856,0.00003878085,0.0001278911,0.9874752,0.00000926454,0.01044939,0.0002340586,0.001305501],"study_design_scores_gemma":[0.0002967728,0.00005292848,0.0007525767,0.00009723399,0.00004981052,0.00001056527,0.00004467572,0.9974775,0.00008382752,0.0007105625,0.00007963572,0.0003439075],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.003208089,0.00001987631,0.993809,0.0002102473,0.001452183,0.0003114968,0.00001206545,0.0003910868,0.0005859036],"genre_scores_gemma":[0.953178,0.0001941407,0.04205262,0.00007006776,0.0001277269,0.000001985982,0.00269607,0.00002028769,0.001659028],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.9517564,"threshold_uncertainty_score":0.9998538,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03488079122941772,"score_gpt":0.2006629496360864,"score_spread":0.1657821584066687,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}