{"id":"W7125609422","doi":"10.1109/cascon66301.2025.00044","title":"Securing LLM-Generated Embedded Firmware Through AI Agent-Driven Validation and Patching","year":2025,"lang":"","type":"article","venue":"","topic":"Security and Verification in Computing","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Ontario Tech University","funders":"","keywords":"Firmware; Buffer overflow; Vulnerability (computing); Process (computing); Implementation; Software; Security testing; Software security assurance","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002575075,0.0007628531,0.0004058283,0.0004954982,0.0003173426,0.001031804,0.001570095,0.0007351069,0.001467477],"category_scores_gemma":[0.01147082,0.0005793817,0.0005253712,0.0001629319,0.0008720526,0.001381096,0.001290409,0.001187943,0.0005801097],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007429195,"about_ca_system_score_gemma":0.001103083,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001430341,"about_ca_topic_score_gemma":0.001408756,"domain_scores_codex":[0.9979458,0.0007013939,0.0001249323,0.0003197485,0.0007402016,0.0001678624],"domain_scores_gemma":[0.9920209,0.003271655,0.0007251362,0.002988562,0.0008608832,0.0001327729],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0006944823,0.0007658004,0.01527158,0.0004086924,0.0001536514,0.0008330013,0.002287565,0.3902682,0.1807638,0.02608596,0.006054056,0.3764132],"study_design_scores_gemma":[0.00004674797,0.0002070718,0.0007013858,0.00002580248,0.00003176539,0.0001239917,0.00007232759,0.897204,0.09164794,0.004226521,0.005682534,0.00002990298],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1216005,0.0000679666,0.8495682,0.00023664,0.00004208724,0.0003371824,0.00008309902,0.02538288,0.00268132],"genre_scores_gemma":[0.5797981,0.0000546072,0.4154783,0.0001771505,0.00001079239,0.0002627005,0.0002621119,0.001664071,0.002292309],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.002575075,"threshold_uncertainty_score":0.01361841,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02987057621087146,"score_gpt":0.3073584967249631,"score_spread":0.2774879205140916,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}