{"id":"W2995031981","doi":"10.48550/arxiv.1912.05109","title":"Doubly Robust Off-Policy Actor-Critic Algorithms for Reinforcement Learning","year":2019,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"","keywords":"Reinforcement learning; Estimator; Computer science; Variance (accounting); Function (biology); Bellman equation; Value (mathematics); Mathematical optimization; Artificial intelligence; Machine learning; Mathematics; Economics; Statistics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0005327715,0.0006325879,0.0006388028,0.0006905723,0.0003734697,0.0004509984,0.003238991,0.0005148227,0.00004391683],"category_scores_gemma":[0.0002552393,0.0007632017,0.000479619,0.0007331167,0.0001305295,0.0007279983,0.003390127,0.001274381,0.0002698328],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008819566,"about_ca_system_score_gemma":0.0008205704,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001622925,"about_ca_topic_score_gemma":0.000004129451,"domain_scores_codex":[0.9965197,0.0001531856,0.0004943637,0.001566227,0.0002915866,0.0009749803],"domain_scores_gemma":[0.996381,0.0003571099,0.0006170014,0.001910946,0.0004459274,0.0002879511],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00002702022,0.0000253865,0.0004221251,0.0002392751,0.0001433757,0.00003805452,0.0002602889,0.9264064,0.00001158947,0.07125249,0.0004752647,0.0006986847],"study_design_scores_gemma":[0.001152637,0.0002642534,0.0001213808,0.0001913274,0.00008886177,0.000004292203,0.00007083482,0.985018,0.00007046285,0.00150154,0.01071208,0.0008043793],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.002664637,0.00005204603,0.9873239,0.0002258274,0.001435889,0.001153772,0.000005412601,0.0005287177,0.006609772],"genre_scores_gemma":[0.9507377,0.0002463171,0.01087981,0.0002353855,0.0003713226,0.000007374077,0.0001008668,0.00006798996,0.03735323],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.9764441,"threshold_uncertainty_score":0.9994819,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1024083187735273,"score_gpt":0.2271524172624324,"score_spread":0.1247440984889051,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}