{"id":"W4399062520","doi":"10.48550/arxiv.2405.15589","title":"Efficient Adversarial Training in LLMs with Continuous Attacks","year":2024,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Adversarial Robustness in Machine Learning","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Deutsche Forschungsgemeinschaft; European Commission; Canadian Institute for Advanced Research","keywords":"Adversarial system; Training (meteorology); Computer security; Computer science; Artificial intelligence; Geography; Meteorology","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002973421,0.00157794,0.001265565,0.0005084542,0.0006530713,0.001225273,0.001700274,0.001923973,0.003410683],"category_scores_gemma":[0.01177268,0.000732488,0.001101303,0.0004073243,0.002203914,0.00297253,0.004525273,0.004364468,0.001467891],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001271811,"about_ca_system_score_gemma":0.001315311,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002816317,"about_ca_topic_score_gemma":0.003467582,"domain_scores_codex":[0.9975624,0.001173818,0.00011463,0.0005040555,0.000414085,0.0002310425],"domain_scores_gemma":[0.9945256,0.003479292,0.0003620203,0.001188145,0.0002706612,0.0001743257],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001748272,0.00005921739,0.00117375,0.00009449728,0.00005569978,0.0001425479,0.0001057289,0.9168483,0.003186631,0.02100692,0.004207217,0.0529446],"study_design_scores_gemma":[0.000009149666,0.00002713802,0.00008240433,0.000009582303,0.000003816131,0.00002793159,0.00001174665,0.9842139,0.001122999,0.01374227,0.0007428877,0.000006121408],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02993109,0.0004974681,0.9610625,0.0008836323,0.0001123718,0.00009953765,0.0002140735,0.003686276,0.003512993],"genre_scores_gemma":[0.7776796,0.0003179323,0.2123639,0.001032391,0.0001219418,0.0002765469,0.0009615472,0.0009608477,0.006285309],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.003410683,"threshold_uncertainty_score":0.01572514,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04664596114631289,"score_gpt":0.2021857883914174,"score_spread":0.1555398272451045,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}