{"id":"W4416464763","doi":"10.1007/978-981-95-4367-0_40","title":"An Ensemble Method with Plans-Managed Policy for Proximal Policy Optimization","year":2025,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"ca_institutions":"Carleton University","funders":"","keywords":"Reinforcement learning; Ensemble learning; Policy learning; Optimization algorithm; Optimization problem; Ensemble forecasting","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001468885,0.000995671,0.002021024,0.0007355511,0.0007761387,0.000877935,0.00224232,0.002430715,0.006176454],"category_scores_gemma":[0.003103673,0.0009666299,0.001146747,0.001044899,0.0007961744,0.001313312,0.002475238,0.002461412,0.001151447],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007215803,"about_ca_system_score_gemma":0.001510466,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005956245,"about_ca_topic_score_gemma":0.005636355,"domain_scores_codex":[0.9994281,0.0001958932,0.00003227204,0.0001102806,0.0001616339,0.00007175073],"domain_scores_gemma":[0.9987531,0.000746737,0.00005684343,0.0001238747,0.0002285876,0.0000909786],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00008097655,0.00007162326,0.0002207663,0.00006891194,0.00007553115,0.00004568474,0.00003995245,0.8747184,0.001404666,0.01441776,0.002225569,0.1066302],"study_design_scores_gemma":[0.000003002779,0.00001076458,0.00001316318,0.000003131453,0.00000324271,0.000004078759,0.000001308444,0.9983646,0.00009353363,0.001300028,0.0002009577,0.000002224768],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.002881146,0.0001678991,0.9954117,0.00004788136,0.00007442344,0.00002408432,0.00002063537,0.0002041942,0.001168106],"genre_scores_gemma":[0.2399158,0.0004370221,0.749661,0.0002373597,0.0002738387,0.0005277675,0.0003095061,0.0004123326,0.008225389],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006176454,"threshold_uncertainty_score":0.02066225,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01507838733675685,"score_gpt":0.2931504114345274,"score_spread":0.2780720240977705,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}