{"id":"W7128225249","doi":"10.1162/tacl.a.27","title":"Investigating Adversarial Trigger Transfer in Large Language Models","year":2025,"lang":"en","type":"article","venue":"Transactions of the Association for Computational Linguistics","topic":"Adversarial Robustness in Machine Learning","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Canadian Institute for Advanced Research","funders":"","keywords":"Adversarial system; Security token; Offensive; Robustness (evolution); Language model; Threat model; Language understanding","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006812424,0.0009049687,0.0008230606,0.000564665,0.0006063094,0.001132913,0.001453933,0.001389797,0.002972712],"category_scores_gemma":[0.03289236,0.0004792129,0.000870406,0.0003432957,0.002058381,0.002598836,0.002271235,0.002882926,0.000415513],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001504141,"about_ca_system_score_gemma":0.001141129,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00229536,"about_ca_topic_score_gemma":0.002084655,"domain_scores_codex":[0.9955223,0.00282904,0.0001380014,0.0005897134,0.0005597537,0.0003611546],"domain_scores_gemma":[0.9692957,0.02544806,0.001536172,0.002569046,0.0006957865,0.0004551501],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001705114,0.00008950493,0.00194149,0.00006111289,0.00005557678,0.0001165916,0.0001637801,0.9713169,0.002078064,0.01299321,0.0006445194,0.01036881],"study_design_scores_gemma":[0.00001025248,0.00005567039,0.0001595768,0.000005990378,0.000006206842,0.00001193281,0.00002184283,0.9839468,0.0009916908,0.01463066,0.0001516493,0.000007609715],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.5215399,0.0003827667,0.4698577,0.001233797,0.00008825446,0.0001730071,0.0003251647,0.002183037,0.004216474],"genre_scores_gemma":[0.9794787,0.00005598449,0.01915249,0.0001463198,0.00001855554,0.00008373985,0.000183802,0.0001486424,0.000731702],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.006812424,"threshold_uncertainty_score":0.03602797,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01217664085012492,"score_gpt":0.2804505190115679,"score_spread":0.2682738781614429,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}