{"id":"W4406458169","doi":"10.1109/bigdata62323.2024.10825802","title":"Are Existing Large Language Models Robust Against Jailbreak Attacks?","year":2024,"lang":"en","type":"article","venue":"","topic":"Hate Speech and Cyberbullying Detection","field":"Computer Science","cited_by":5,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Manitoba","funders":"Natural Sciences and Engineering Research Council of Canada; University of Manitoba","keywords":"Computer science; Computer security","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0002843571,0.000135304,0.0001134186,0.0001197693,0.0001450253,0.0005261852,0.0003899953,0.00006846205,0.00004940108],"category_scores_gemma":[0.00002518934,0.0001153278,0.00007856605,0.0004597844,0.0000114583,0.0007261282,0.0001829535,0.0001869636,0.0004924639],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00004678178,"about_ca_system_score_gemma":0.0000309831,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00003699017,"about_ca_topic_score_gemma":0.00006859968,"domain_scores_codex":[0.9987993,0.00003339893,0.0001585877,0.0004262507,0.0002247985,0.0003577149],"domain_scores_gemma":[0.9993899,0.00004233206,0.00004021477,0.0003923725,0.00003802319,0.00009718961],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00001240688,0.0002515992,0.0002637826,0.0004705871,0.0001747095,0.00352523,0.00869328,0.03747457,0.009154426,0.3657405,0.05158067,0.5226582],"study_design_scores_gemma":[0.0001160669,0.00001736846,0.00006326416,0.0001125736,0.000004336928,0.00003630182,0.0004030137,0.9829181,0.002581256,0.00103946,0.01248016,0.0002280801],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.03465322,0.0005979196,0.8721592,0.0004577625,0.0006626223,0.00009496195,0.000005441376,0.001554413,0.08981444],"genre_scores_gemma":[0.9575651,0.00002079231,0.03014866,0.0007422678,0.0002424492,0.00001318386,0.000005685765,0.00002195282,0.01123988],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9454436,"threshold_uncertainty_score":0.6329792,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03804687895985621,"score_gpt":0.2714046516492349,"score_spread":0.2333577726893787,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}