{"id":"W4416035462","doi":"10.18653/v1/2025.emnlp-main.1430","title":"Improving Large Language Model Safety with Contrastive Representation Learning","year":2025,"lang":"en","type":"article","venue":"","topic":"Adversarial Robustness in Machine Learning","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Natural Sciences and Engineering Research Council of Canada; National Supercomputing Centre Singapore; National Science Foundation; Centro Svizzero di Calcolo Scientifico; Bundesministerium für Bildung und Forschung; Schweizerischer Nationalfonds zur Förderung der Wissenschaftlichen Forschung","keywords":"Representation (politics); Feature (linguistics); Natural language; Language identification; Language model; Quality (philosophy)","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003991143,0.00144733,0.001041351,0.0006578821,0.0006978398,0.001680388,0.001835822,0.001864768,0.002498393],"category_scores_gemma":[0.01918821,0.0004876556,0.00127378,0.0004816109,0.001842533,0.004394656,0.004707349,0.004883109,0.001278705],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001080052,"about_ca_system_score_gemma":0.001393505,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001165675,"about_ca_topic_score_gemma":0.001443308,"domain_scores_codex":[0.997026,0.001297536,0.0001196709,0.0005209363,0.0008202226,0.0002156546],"domain_scores_gemma":[0.9886264,0.007084599,0.0009239883,0.002606,0.0005470971,0.0002119556],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0004101443,0.0003403174,0.003052637,0.0001757575,0.0001461276,0.0003698526,0.00032529,0.6879179,0.02405189,0.07572129,0.007208327,0.2002804],"study_design_scores_gemma":[0.00001356589,0.00006934574,0.0000606154,0.000007910682,0.000008922944,0.00006189694,0.00001668662,0.9698295,0.003583492,0.02572544,0.0006138284,0.00000885255],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.03708819,0.0003379104,0.9569304,0.0008750701,0.00006915857,0.0000907894,0.00009955246,0.002660695,0.00184818],"genre_scores_gemma":[0.8367224,0.0002572976,0.1572772,0.0009011702,0.0001207208,0.0001740177,0.0004896576,0.0005055406,0.003551975],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.003991143,"threshold_uncertainty_score":0.02110744,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.005280031098914127,"score_gpt":0.2679396322120302,"score_spread":0.262659601113116,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}