{"id":"W4393103270","doi":"10.1016/j.automatica.2024.111642","title":"Stabilizing reinforcement learning control: A modular framework for optimizing over all stable behavior","year":2024,"lang":"en","type":"article","venue":"Automatica","topic":"Adaptive Dynamic Programming Control","field":"Computer Science","cited_by":7,"is_retracted":false,"has_abstract":true,"ca_institutions":"Honeywell (Canada); University of British Columbia","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Reinforcement learning; Modular design; Stability (learning theory); Reinforcement; Control (management); Computer science; Control theory (sociology); Control engineering; Engineering; Artificial intelligence; Machine learning; Structural engineering","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001782557,0.001221802,0.0008962068,0.0004945056,0.0003500766,0.001225423,0.001888602,0.001107288,0.00291949],"category_scores_gemma":[0.002628082,0.0004657815,0.0007414246,0.0003586159,0.001987974,0.00115872,0.001886527,0.002108907,0.0006060982],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001028563,"about_ca_system_score_gemma":0.001459436,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001642659,"about_ca_topic_score_gemma":0.001893071,"domain_scores_codex":[0.9993619,0.0001668459,0.00003165247,0.0001655693,0.0002056911,0.00006821603],"domain_scores_gemma":[0.9993198,0.0002682543,0.00009671117,0.0001156171,0.0001425492,0.00005700569],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00004060616,0.00003676975,0.0001828939,0.00007265803,0.00004009643,0.00004535338,0.00006949309,0.8412629,0.004482368,0.1233107,0.0009295395,0.02952664],"study_design_scores_gemma":[0.000009109641,0.00002902787,0.0000191308,0.000007412438,0.000004659948,0.00000606303,0.000003296346,0.9732515,0.0005649563,0.0255575,0.0005416706,0.000005742738],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.001635511,0.00004169756,0.9968899,0.00006629479,0.00001167408,0.00001697047,0.00001147085,0.0001409079,0.001185537],"genre_scores_gemma":[0.5991974,0.0003289277,0.3948775,0.0002635236,0.00009860521,0.000524994,0.00009270995,0.0002216284,0.004394709],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.00291949,"threshold_uncertainty_score":0.009766698,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01738113249222614,"score_gpt":0.2899690171600185,"score_spread":0.2725878846677924,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}