{"id":"W4392669834","doi":"10.18653/v1/2023.artofsafety-1.5","title":"Discovering Safety Issues in Text-to-Image Models: Insights from Adversarial Nibbler Challenge","year":2023,"lang":"en","type":"article","venue":"","topic":"Adversarial Robustness in Machine Learning","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"","keywords":"Adversarial system; White (mutation); Content analysis; Content (measure theory); Psychology; Social psychology; Computer science; Internet privacy; Artificial intelligence; Sociology; Social science","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0003058728,0.000281116,0.0003616926,0.00040659,0.0001702053,0.0002102651,0.001391545,0.000127169,0.00008911351],"category_scores_gemma":[0.0001635715,0.0002597091,0.00008232992,0.001227811,0.00003844492,0.002134804,0.001675212,0.0004002267,0.0007390348],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000138157,"about_ca_system_score_gemma":0.00006323176,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002339093,"about_ca_topic_score_gemma":0.0008389481,"domain_scores_codex":[0.9975059,0.0001628495,0.0004186611,0.0008679596,0.0005207847,0.0005238594],"domain_scores_gemma":[0.9986298,0.0002963014,0.00007327923,0.0008058357,0.00004221312,0.0001525829],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00006671646,0.00006641852,0.0002303452,0.00001376108,0.00003199256,0.0001757599,0.0149797,0.8139848,0.0006200349,0.1574331,0.0007977401,0.01159965],"study_design_scores_gemma":[0.0008281692,0.00004180397,0.00251526,0.00006358277,0.000004022073,6.75229e-7,0.0005079227,0.9594401,0.0001736373,0.03126279,0.004749856,0.0004122063],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02885436,0.00008648073,0.9304035,0.004853368,0.001143391,0.0003203045,0.000005098446,0.00094968,0.03338382],"genre_scores_gemma":[0.9112727,0.00009484645,0.08658246,0.0002406038,0.0004459065,0.00002631515,0.00001762336,0.00004088686,0.001278661],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.8824183,"threshold_uncertainty_score":0.9999855,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02314821895900354,"score_gpt":0.2776442431533271,"score_spread":0.2544960241943235,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}