{"id":"W4415947615","doi":"10.1007/978-3-032-10489-2_36","title":"Evaluating AI Agents for Cyber Defense: A Comparison of Deep Reinforcement Learning and LLM Approaches","year":2025,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Adversarial Robustness in Machine Learning","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"ca_institutions":"Dalhousie University","funders":"","keywords":"Reinforcement learning; Adaptability; Curiosity; Robustness (evolution); Transparency (behavior); Autonomous agent; Intelligent agent; Deep learning","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005873733,0.001109555,0.00125012,0.0009755791,0.0003527097,0.001439447,0.001989703,0.001993233,0.003010809],"category_scores_gemma":[0.01412791,0.0003622081,0.0003765092,0.0005634648,0.0009798589,0.002321947,0.001763252,0.001787436,0.0004199719],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002326281,"about_ca_system_score_gemma":0.001742583,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005133568,"about_ca_topic_score_gemma":0.005327766,"domain_scores_codex":[0.9979031,0.0011888,0.00008372116,0.0002055184,0.000446333,0.0001724736],"domain_scores_gemma":[0.9855587,0.01132251,0.0007375437,0.0008523017,0.00107237,0.0004564403],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0005834443,0.0002647694,0.002731946,0.000197085,0.0001099763,0.00002669472,0.00004222665,0.880007,0.0007058492,0.007587227,0.001804969,0.1059388],"study_design_scores_gemma":[0.00001325998,0.00006287621,0.0001492217,0.000008598885,0.000006375953,0.000003794572,0.000006811151,0.9971939,0.0002103503,0.002178631,0.0001635022,0.000002559568],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3612482,0.006593235,0.5933836,0.003151843,0.0004175564,0.0004535753,0.0004044553,0.002797527,0.03154999],"genre_scores_gemma":[0.9357243,0.0004418334,0.06072888,0.0001983179,0.00006034994,0.00008236987,0.0001840465,0.0001037244,0.002476279],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.005873733,"threshold_uncertainty_score":0.03106368,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06335727882812493,"score_gpt":0.3479322205925678,"score_spread":0.2845749417644429,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}