{"id":"W4417132686","doi":"10.1109/istas65609.2025.11269659","title":"Security Degradation in Iterative AI Code Generation: A Systematic Analysis of the Paradox","year":2025,"lang":"","type":"article","venue":"","topic":"Information and Cyber Security","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Vector Institute","funders":"","keywords":"Code (set theory); Vulnerability (computing); Source code; Software; Code review; Secure coding; Software security assurance","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.05039387,0.0006474063,0.0006236679,0.002373803,0.001361082,0.002085015,0.001905836,0.001089131,0.0008438491],"category_scores_gemma":[0.2909074,0.000609695,0.0006019071,0.001292036,0.004561054,0.003569698,0.002881602,0.002273379,0.0001485706],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003491342,"about_ca_system_score_gemma":0.003822858,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002011778,"about_ca_topic_score_gemma":0.0030686,"domain_scores_codex":[0.9517208,0.03399749,0.002001165,0.003864334,0.007747779,0.000668394],"domain_scores_gemma":[0.4262362,0.4916243,0.02506163,0.03040855,0.02547488,0.001194562],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.003872981,0.003178823,0.233611,0.005767987,0.001039565,0.001543612,0.1360079,0.04266489,0.04215663,0.02689228,0.004107494,0.4991568],"study_design_scores_gemma":[0.001439384,0.01322653,0.316245,0.00466441,0.002081511,0.002538044,0.06133972,0.3481275,0.1104406,0.1043367,0.03443649,0.001124097],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9530485,0.001060372,0.04159021,0.0007882996,0.00002976436,0.0006985419,0.0001082992,0.0003223297,0.002353698],"genre_scores_gemma":[0.9658787,0.0002672319,0.03272516,0.0002782652,0.00001012389,0.0004237631,0.00008544129,0.00008058027,0.0002508011],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9496061,"threshold_uncertainty_score":0.2665114,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01517541038438253,"score_gpt":0.2707679467877709,"score_spread":0.2555925364033884,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}