{"id":"W4401687215","doi":"10.1109/access.2024.3446310","title":"Finding the Optimal Security Policies for Autonomous Cyber Operations With Competitive Reinforcement Learning","year":2024,"lang":"en","type":"article","venue":"IEEE Access","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":5,"is_retracted":false,"has_abstract":true,"ca_institutions":"Defence Research and Development Canada; Royal Military College of Canada","funders":"","keywords":"Reinforcement learning; Computer science; Computer security; Artificial intelligence","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001659663,0.000858703,0.0007079938,0.0005790107,0.0004398352,0.0007227686,0.0009793638,0.001038684,0.00161683],"category_scores_gemma":[0.007493986,0.0004295153,0.0004413587,0.0002575736,0.001265185,0.0007355851,0.0007817742,0.001332456,0.0001951033],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001361377,"about_ca_system_score_gemma":0.001627723,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01091545,"about_ca_topic_score_gemma":0.009777697,"domain_scores_codex":[0.9995157,0.0001931985,0.00002592315,0.00007750115,0.0001068971,0.0000807688],"domain_scores_gemma":[0.9963527,0.002655528,0.0003103725,0.0001394512,0.0003790236,0.000162933],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00002882705,0.00003797438,0.0006096988,0.00001957576,0.00001340415,0.00002188298,0.00003375878,0.9902872,0.0003709605,0.003523548,0.0001435819,0.004909584],"study_design_scores_gemma":[0.000003531925,0.0000135308,0.00003143839,0.000001624263,0.000001431777,0.000002525263,0.000002823005,0.9988997,0.00008633204,0.0009188074,0.00003690106,0.000001329496],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2294824,0.0002911293,0.7611203,0.0005884928,0.0000658206,0.0001727066,0.00005256777,0.0003504318,0.007876159],"genre_scores_gemma":[0.9589724,0.00005403626,0.03978629,0.0001028854,0.00001076368,0.00007842451,0.0000316919,0.0000219177,0.0009416526],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01091545,"threshold_uncertainty_score":0.02170384,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03052046548776626,"score_gpt":0.3178122432086103,"score_spread":0.287291777720844,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}