{"id":"W7124314397","doi":"10.65109/xqbl5396","title":"Divide and Conquer: Provably Unveiling the Pareto Front with Multi-Objective Reinforcement Learning","year":2025,"lang":"","type":"article","venue":"","topic":"Advanced Multi-Objective Optimization Algorithms","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Mila - Quebec Artificial Intelligence Institute","funders":"","keywords":"Reinforcement learning; Pareto principle; Convergence (economics); Sequence (biology); Multi-objective optimization; Iterated function; Pareto optimal","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003870604,0.001746904,0.00156548,0.000807229,0.0008267133,0.001440419,0.001676451,0.001874879,0.002816882],"category_scores_gemma":[0.009316282,0.0007372634,0.0008623362,0.0006515833,0.00258329,0.001968398,0.002924683,0.003265743,0.0004234355],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001405788,"about_ca_system_score_gemma":0.001883915,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003050225,"about_ca_topic_score_gemma":0.003069189,"domain_scores_codex":[0.9986218,0.0006085801,0.00004606273,0.0001711629,0.0003955541,0.0001567564],"domain_scores_gemma":[0.9956002,0.003200188,0.0003408043,0.0003198731,0.0003313367,0.0002074704],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001089168,0.00007780846,0.0006549718,0.0000872101,0.00005718806,0.00008528223,0.0001097151,0.9200593,0.001050803,0.04134932,0.001295267,0.03506421],"study_design_scores_gemma":[0.00002018553,0.00002769007,0.00002950532,0.0000137449,0.00000520783,0.000008823607,0.00000779046,0.9786541,0.0002814251,0.02057821,0.0003695801,0.000003739223],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0239632,0.0004635234,0.968765,0.0004564782,0.00004684909,0.00009338073,0.00003737187,0.0003541213,0.005820014],"genre_scores_gemma":[0.6932386,0.0003678742,0.3014165,0.0004185223,0.00007846548,0.0004493533,0.000103083,0.000237356,0.003690195],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.003870604,"threshold_uncertainty_score":0.02046996,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01111837383102077,"score_gpt":0.2579120185232933,"score_spread":0.2467936446922725,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}