{"id":"W4382239271","doi":"10.1609/aaai.v37i6.25864","title":"The Sufficiency of Off-Policyness and Soft Clipping: PPO Is Still Insufficient according to an Off-Policy Measure","year":2023,"lang":"en","type":"article","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","topic":"Optimization and Search Problems","field":"Computer Science","cited_by":15,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"Natural Sciences and Engineering Research Council of Canada; National Natural Science Foundation of China; Alberta Machine Intelligence Institute","keywords":"Clipping (morphology); Computer science; Space (punctuation); Metric (unit); Measure (data warehouse); Mathematical optimization; Sigmoid function; Code (set theory); Function (biology); Algorithm; Mathematics; Data mining; Artificial intelligence; Economics; Operations management; Programming language","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006092813,0.001409032,0.002530162,0.0007949966,0.0009953713,0.002531665,0.001929239,0.002744474,0.003700739],"category_scores_gemma":[0.04221146,0.0007477489,0.0007523607,0.0006247009,0.003051184,0.004346449,0.00335487,0.004640718,0.0005215592],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001198033,"about_ca_system_score_gemma":0.003035767,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002211566,"about_ca_topic_score_gemma":0.001290664,"domain_scores_codex":[0.9965593,0.001170857,0.0002570732,0.0006832008,0.0009024128,0.0004271451],"domain_scores_gemma":[0.9769598,0.01757205,0.001192491,0.001819529,0.00143872,0.001017484],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0008140879,0.0004061183,0.005902322,0.0007896855,0.0002026585,0.000560746,0.0005362919,0.7064517,0.005981254,0.1321394,0.009447197,0.1367685],"study_design_scores_gemma":[0.00004372288,0.0002423046,0.000624285,0.0001057509,0.00002423725,0.0001640356,0.0000641161,0.9426427,0.002341168,0.05200065,0.00171965,0.0000272436],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.07217481,0.001046945,0.9125005,0.002105315,0.0002378258,0.0001579131,0.0001739435,0.0008693109,0.01073344],"genre_scores_gemma":[0.8529047,0.0004950435,0.1396651,0.00129185,0.0002042787,0.000308162,0.0003072414,0.0004770967,0.004346514],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006092813,"threshold_uncertainty_score":0.03222227,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1051787284617897,"score_gpt":0.3426599136300764,"score_spread":0.2374811851682866,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}