{"id":"W4392669834","doi":"10.18653/v1/2023.artofsafety-1.5","title":"Discovering Safety Issues in Text-to-Image Models: Insights from Adversarial Nibbler Challenge","year":2023,"lang":"en","type":"article","venue":"","topic":"Adversarial Robustness in Machine Learning","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"","keywords":"Adversarial system; White (mutation); Content analysis; Content (measure theory); Psychology; Social psychology; Computer science; Internet privacy; Artificial intelligence; Sociology; Social science","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003490664,0.0006335938,0.0004022258,0.0006805417,0.0009141823,0.002363011,0.001083742,0.00197638,0.00427316],"category_scores_gemma":[0.02934177,0.0002427357,0.0006350453,0.0004117913,0.002238773,0.003376179,0.001731177,0.002192083,0.0008311429],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001577373,"about_ca_system_score_gemma":0.0006030253,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003382352,"about_ca_topic_score_gemma":0.00228732,"domain_scores_codex":[0.9974269,0.001652111,0.00006658236,0.0003135977,0.0004232441,0.0001174644],"domain_scores_gemma":[0.9710586,0.02405662,0.001518082,0.001534038,0.001341306,0.0004913963],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.003152296,0.001882614,0.07483251,0.00202383,0.0002529732,0.005497111,0.06361262,0.3219829,0.0343097,0.3184496,0.03800999,0.1359937],"study_design_scores_gemma":[0.00007677135,0.0003593164,0.00544499,0.0001074121,0.00003607485,0.0006550868,0.006011082,0.8811203,0.005256888,0.08191571,0.01892818,0.00008820357],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.768436,0.0006314546,0.1866825,0.009291706,0.0002111924,0.0007144902,0.001477443,0.0007823743,0.03177295],"genre_scores_gemma":[0.9587181,0.0001432286,0.03409394,0.0006813863,0.00006503896,0.0002253165,0.0008695219,0.0001520786,0.005051435],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.00427316,"threshold_uncertainty_score":0.01846057,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02314821895900354,"score_gpt":0.2776442431533271,"score_spread":0.2544960241943235,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}