{"id":"W4394944255","doi":"10.3390/robotics13040063","title":"Safe Reinforcement Learning for Arm Manipulation with Constrained Markov Decision Process","year":2024,"lang":"en","type":"article","venue":"Robotics","topic":"Robot Manipulation and Learning","field":"Engineering","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"Western University","funders":"","keywords":"Reinforcement learning; Markov decision process; Process (computing); Computer science; Partially observable Markov decision process; Artificial intelligence; Markov chain; Reinforcement; Markov process; Machine learning; Engineering; Markov model; Mathematics; Programming language","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001596523,0.0009388394,0.00106616,0.0004105588,0.0003885036,0.0007504551,0.001003122,0.0009114146,0.00298579],"category_scores_gemma":[0.005150321,0.0005726331,0.0005195561,0.0003513902,0.001254189,0.0008565942,0.001349567,0.002058666,0.0003179898],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00138385,"about_ca_system_score_gemma":0.002096283,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00703006,"about_ca_topic_score_gemma":0.005738568,"domain_scores_codex":[0.9992651,0.0002552941,0.00003196487,0.0001615473,0.0001746877,0.0001114767],"domain_scores_gemma":[0.9972663,0.002052891,0.0002804744,0.00008778663,0.0001993845,0.0001132668],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00008906671,0.00003571106,0.0003171185,0.00003645188,0.00001772113,0.00005200728,0.00003721385,0.9761825,0.0008765063,0.009111442,0.0002052433,0.01303897],"study_design_scores_gemma":[0.000005624779,0.00001298227,0.00001870654,0.000001841218,0.000001471797,0.000002655012,0.000001037503,0.9974118,0.0001446097,0.002344697,0.00005283671,0.000001802997],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01780137,0.0001565083,0.9801266,0.0001713155,0.00002192849,0.00004139222,0.00002200833,0.0003795563,0.001279411],"genre_scores_gemma":[0.9108011,0.000145162,0.08563232,0.0001334081,0.00002509683,0.0001687156,0.00006167244,0.00006399625,0.002968587],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.00703006,"threshold_uncertainty_score":0.0139783,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01842831946777056,"score_gpt":0.2610140964488706,"score_spread":0.2425857769811001,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}