{"id":"W7125609422","doi":"10.1109/cascon66301.2025.00044","title":"Securing LLM-Generated Embedded Firmware Through AI Agent-Driven Validation and Patching","year":2025,"lang":"","type":"article","venue":"","topic":"Security and Verification in Computing","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Ontario Tech University","funders":"","keywords":"Firmware; Buffer overflow; Vulnerability (computing); Process (computing); Implementation; Software; Security testing; Software security assurance","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.0005361465,0.0004113748,0.0003924746,0.0002197715,0.001272435,0.001652112,0.000896996,0.0002634336,0.0001754471],"category_scores_gemma":[0.0001398283,0.0004552267,0.0001196955,0.001373601,0.0001098625,0.001579165,0.0009757109,0.0005201887,0.00004882966],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001376606,"about_ca_system_score_gemma":0.0003077259,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0002091867,"about_ca_topic_score_gemma":0.00001951777,"domain_scores_codex":[0.9965518,0.0003741098,0.000859377,0.001230834,0.0004020539,0.0005818313],"domain_scores_gemma":[0.9980723,0.00028359,0.0002781996,0.0008617442,0.0003739814,0.0001302281],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00005856425,0.0008075756,0.005773654,0.001129378,0.000526578,0.00003683167,0.06625298,0.03329413,0.007125416,0.6743281,0.01067683,0.19999],"study_design_scores_gemma":[0.0007821966,0.00006865169,0.0008769353,0.0004433116,0.00004991598,0.00001237647,0.0008534855,0.9528849,0.03025432,0.007052796,0.006195178,0.0005259457],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1388195,0.001009743,0.8480006,0.00384305,0.001993345,0.0004349014,0.00000612399,0.0003331811,0.005559572],"genre_scores_gemma":[0.9645177,0.0002963752,0.03106854,0.002957426,0.0002256735,0.00001708838,0.00002497818,0.00001733709,0.0008749415],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9195908,"threshold_uncertainty_score":0.99979,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02987057621087146,"score_gpt":0.3073584967249631,"score_spread":0.2774879205140916,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}