{"id":"W4391756312","doi":"10.21203/rs.3.rs-3918353/v1","title":"Specialized Deep Residual Policy Safe Reinforcement Learning-Based Controller for Complex and Continuous State-Action Spaces","year":2024,"lang":"en","type":"preprint","venue":"Research Square","topic":"Smart Grid Security and Resilience","field":"Engineering","cited_by":5,"is_retracted":false,"has_abstract":false,"ca_institutions":"","funders":"Science Foundation Ireland; European Commission; Canadian Institute of Steel Construction","keywords":"Reinforcement learning; Residual; Action (physics); Computer science; State (computer science); Controller (irrigation); Artificial intelligence; Control theory (sociology); Reinforcement; Control engineering; Control (management); Engineering; Psychology; Algorithm; Physics; Social psychology","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.001204439,0.0003600831,0.0005733093,0.0007773829,0.0003356157,0.0005580565,0.0002737085,0.0003284662,0.0001555787],"category_scores_gemma":[0.0005778253,0.0003385622,0.0001658237,0.0003262965,0.0002681092,0.00005699178,0.0004373829,0.001801901,0.00005921283],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0004399213,"about_ca_system_score_gemma":0.0003406109,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0005822803,"about_ca_topic_score_gemma":0.0004407818,"domain_scores_codex":[0.9970153,0.0002601576,0.0004364636,0.0005648666,0.0008704397,0.0008527617],"domain_scores_gemma":[0.9983408,0.0006701688,0.00006350717,0.0003173382,0.000362899,0.0002452264],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0009392645,0.0000464191,0.0001530999,0.007716809,0.0002866514,0.00004200246,0.0021887,0.961796,0.001918983,0.00174899,0.0146127,0.008550369],"study_design_scores_gemma":[0.002386376,0.0005196939,0.001319361,0.000868431,0.00003921137,0.000004302194,0.001023531,0.8466616,0.001589208,0.004043519,0.1409622,0.0005825353],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.6874392,0.04028939,0.1527498,0.01907313,0.008500546,0.03825112,0.002061906,0.005793503,0.04584137],"genre_scores_gemma":[0.9944041,0.001389547,0.0003066492,0.00002785521,0.001448882,0.0005241464,0.0002729636,0.0000943811,0.001531456],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.3069649,"threshold_uncertainty_score":0.9999067,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05785780633926838,"score_gpt":0.3738595371655954,"score_spread":0.3160017308263271,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}