{"id":"W4417132686","doi":"10.1109/istas65609.2025.11269659","title":"Security Degradation in Iterative AI Code Generation: A Systematic Analysis of the Paradox","year":2025,"lang":"","type":"article","venue":"","topic":"Information and Cyber Security","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Vector Institute","funders":"","keywords":"Code (set theory); Vulnerability (computing); Source code; Software; Code review; Secure coding; Software security assurance","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001264381,0.0002331865,0.0007156779,0.0008221347,0.0002513705,0.0004408732,0.0009664883,0.0001406008,0.0001108853],"category_scores_gemma":[0.0001882624,0.0001645377,0.0003541265,0.008088983,0.0000969903,0.001160372,0.0003024435,0.0002683284,0.00001204834],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001871423,"about_ca_system_score_gemma":0.0003830778,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001967234,"about_ca_topic_score_gemma":0.005150615,"domain_scores_codex":[0.9963896,0.0008531019,0.001590674,0.0003616308,0.0005620131,0.0002430045],"domain_scores_gemma":[0.9976345,0.0001758241,0.0005503214,0.001069564,0.0005239784,0.00004577415],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000008591863,0.0002442024,0.003948361,0.002877699,0.0008746792,0.000001007765,0.0294167,0.007530267,0.0000368718,0.9537286,0.0009543064,0.0003786702],"study_design_scores_gemma":[0.000337194,0.00001652356,0.00555413,0.0008549021,0.0005329719,9.346382e-7,0.000514282,0.9886174,0.002242146,0.001119236,0.00005639695,0.0001538581],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.07632904,0.0005743407,0.9000945,0.006461949,0.001445194,0.001897936,0.0000415698,0.00004347939,0.01311196],"genre_scores_gemma":[0.9959175,0.000022345,0.0003671846,0.002572119,0.00001363587,0.00005437964,0.00001584802,0.000002283133,0.001034708],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9810871,"threshold_uncertainty_score":0.6709654,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01517541038438253,"score_gpt":0.2707679467877709,"score_spread":0.2555925364033884,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}