{"id":"W7102328828","doi":"","title":"Advantage Shaping as Surrogate Reward Maximization: Unifying Pass@K Policy Gradients","year":2025,"lang":"","type":"article","venue":"arXiv (Cornell University)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Reinforcement learning; Perspective (graphical); Simple (philosophy); Surrogate model; Verifiable secret sharing; Optimization problem","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0005838124,0.0006414635,0.0005692295,0.00143689,0.001170649,0.0005811529,0.002824644,0.0003340324,0.0001548899],"category_scores_gemma":[0.0004439016,0.0008548881,0.0003363794,0.006347504,0.0003787118,0.001964705,0.002096565,0.0007479317,0.0005980755],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00107934,"about_ca_system_score_gemma":0.001043055,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0003082938,"about_ca_topic_score_gemma":0.00001633106,"domain_scores_codex":[0.995652,0.0004265032,0.000656279,0.001687701,0.0003019483,0.001275528],"domain_scores_gemma":[0.9964854,0.0002789923,0.0005742156,0.001790304,0.0004565288,0.0004146164],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00004589944,0.00005395993,0.01263348,0.0001093428,0.0001375863,0.0003420996,0.0004143098,0.6375499,0.00002106486,0.3474216,0.0001206913,0.001150032],"study_design_scores_gemma":[0.00182373,0.0001866098,0.002366547,0.0005783951,0.0001641368,0.00001318193,0.0004806112,0.9808972,0.0001314408,0.006533184,0.006059456,0.0007654974],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02782515,0.0001239349,0.9273641,0.0009494956,0.00167948,0.0005109414,0.000004729343,0.0003644165,0.04117778],"genre_scores_gemma":[0.9511844,0.001009108,0.00143039,0.0009507831,0.0001271695,6.940109e-7,0.00001498174,0.00003828672,0.04524422],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9259337,"threshold_uncertainty_score":0.9993902,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06663284614697988,"score_gpt":0.2247884175724866,"score_spread":0.1581555714255067,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}