{"id":"W4406458169","doi":"10.1109/bigdata62323.2024.10825802","title":"Are Existing Large Language Models Robust Against Jailbreak Attacks?","year":2024,"lang":"en","type":"article","venue":"","topic":"Hate Speech and Cyberbullying Detection","field":"Computer Science","cited_by":5,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Manitoba","funders":"Natural Sciences and Engineering Research Council of Canada; University of Manitoba","keywords":"Computer science; Computer security","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01131812,0.001259627,0.001146375,0.001722575,0.001126119,0.004187033,0.001957973,0.001880624,0.002868533],"category_scores_gemma":[0.06768389,0.0008056417,0.001155559,0.000762948,0.00205772,0.00862687,0.002470934,0.003768601,0.002732925],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001316299,"about_ca_system_score_gemma":0.001990373,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004571023,"about_ca_topic_score_gemma":0.005679737,"domain_scores_codex":[0.9906552,0.005270479,0.000474179,0.001699581,0.00131989,0.0005807391],"domain_scores_gemma":[0.938412,0.03862416,0.004425271,0.01329313,0.004041736,0.001203782],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001967594,0.001020531,0.09132659,0.0009879048,0.001332984,0.0007529279,0.005749676,0.4180233,0.03192458,0.04031012,0.01251622,0.3940876],"study_design_scores_gemma":[0.00004671308,0.0002687462,0.004023929,0.00009912065,0.0001222491,0.0002315812,0.0007605612,0.948535,0.005632865,0.03620984,0.003977906,0.0000915411],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3872543,0.001543188,0.5836045,0.004705464,0.0003131664,0.0003604032,0.001542431,0.008681668,0.01199477],"genre_scores_gemma":[0.9440621,0.0002849991,0.05141817,0.0007549935,0.00009648095,0.0001300885,0.00115922,0.0004987704,0.001595266],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01131812,"threshold_uncertainty_score":0.05985665,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03804687895985621,"score_gpt":0.2714046516492349,"score_spread":0.2333577726893787,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}