{"id":"W4392182143","doi":"10.1109/icra57147.2024.10611316","title":"Safety Optimized Reinforcement Learning via Multi-Objective Policy Optimization","year":2024,"lang":"en","type":"preprint","venue":"","topic":"Software Reliability and Analysis Research","field":"Computer Science","cited_by":5,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Victoria","funders":"","keywords":"Reinforcement learning; Computer science; Reinforcement; Artificial intelligence; Psychology; Social psychology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001735011,0.001083319,0.0009584407,0.0005531597,0.0003628005,0.0008335226,0.001130246,0.001043041,0.001627589],"category_scores_gemma":[0.00579539,0.0004720582,0.0004703996,0.0002931777,0.001340737,0.0008740253,0.001364422,0.0017517,0.0003442414],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007977426,"about_ca_system_score_gemma":0.001918194,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00260516,"about_ca_topic_score_gemma":0.0020704,"domain_scores_codex":[0.9991842,0.0002636429,0.00003969494,0.0001372682,0.0002472917,0.0001279398],"domain_scores_gemma":[0.9974242,0.001634716,0.0003355284,0.000160132,0.0003310165,0.000114401],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00003669735,0.00002879595,0.0002848522,0.00003682335,0.00001716552,0.00003841227,0.00003378043,0.9761169,0.0009206794,0.005907763,0.0002956358,0.01628251],"study_design_scores_gemma":[0.000006241022,0.00001700196,0.00002376932,0.000003100939,0.000002037979,0.000004898382,0.00000221511,0.9975367,0.0002679337,0.00203139,0.0001028292,0.000001842077],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.01180989,0.0001184031,0.9858489,0.0001177685,0.00002451957,0.00003832444,0.00001447951,0.0003874883,0.001640266],"genre_scores_gemma":[0.8532879,0.0001409534,0.1436702,0.0001809555,0.00004083162,0.0001753199,0.00007267676,0.0001269104,0.002304401],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.00260516,"threshold_uncertainty_score":0.009175777,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02094009631972392,"score_gpt":0.3142482420144251,"score_spread":0.2933081456947012,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}