{"id":"W3212744543","doi":"10.48550/arxiv.2111.08172","title":"Off-Policy Actor-Critic with Emphatic Weightings","year":2021,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Counterexample; Variety (cybernetics); Computer science; Variance (accounting); Work (physics); Gradient method; Mathematical optimization; Mathematics; Mathematical economics; Applied mathematics; Economics; Artificial intelligence; Discrete mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0001927555,0.0004470175,0.0004570337,0.0004211158,0.0002126548,0.000508975,0.002442943,0.0002743513,0.00005703872],"category_scores_gemma":[0.0001199754,0.0004796102,0.000195372,0.001140927,0.0001702587,0.0006722703,0.002690001,0.0008019894,0.00009782645],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0004371788,"about_ca_system_score_gemma":0.0009710281,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001767818,"about_ca_topic_score_gemma":0.00002138173,"domain_scores_codex":[0.9974973,0.0001713942,0.0002598694,0.001247753,0.0002350789,0.0005886525],"domain_scores_gemma":[0.9970456,0.0001748704,0.000335453,0.001883248,0.0003123681,0.0002484794],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000008874797,0.00004253195,0.002276276,0.0001590484,0.0001332188,0.0007719701,0.0005651497,0.9218631,0.00001758593,0.07373411,0.00008720925,0.0003409061],"study_design_scores_gemma":[0.0006178068,0.0001264907,0.00134924,0.0004508206,0.0001123618,0.0000273811,0.0002000789,0.9931117,0.000171366,0.002019714,0.001002989,0.0008100186],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1242654,0.00005943242,0.8680521,0.0002484306,0.0003710454,0.0002406175,0.000001632638,0.0003555465,0.006405751],"genre_scores_gemma":[0.9865977,0.0001761291,0.007267121,0.0002919871,0.0001282078,0.000001104647,0.00002060008,0.00003561083,0.005481552],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.8623323,"threshold_uncertainty_score":0.9997656,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04648557504175391,"score_gpt":0.186150771689604,"score_spread":0.1396651966478501,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}