{"id":"W7125955600","doi":"10.1109/ase63991.2025.00102","title":"Backdoors in Code Summarizers: How Bad Is It?","year":2025,"lang":"","type":"article","venue":"","topic":"Adversarial Robustness in Machine Learning","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"Ministry of Education","keywords":"Backdoor; Code (set theory); Task (project management); Inference; Automatic summarization; Software","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","scholarly_communication","insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.001585114,0.0006043659,0.0007812298,0.0007966946,0.000363699,0.001040443,0.003030654,0.0004641196,0.001389528],"category_scores_gemma":[0.001045458,0.0006325237,0.0002584197,0.003418963,0.0002957113,0.002024924,0.002546366,0.001473148,0.0003285975],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0004148354,"about_ca_system_score_gemma":0.0008989933,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0008246019,"about_ca_topic_score_gemma":0.0007808178,"domain_scores_codex":[0.9950528,0.0005898182,0.0008204359,0.001637495,0.0007231593,0.001176366],"domain_scores_gemma":[0.9969183,0.0007562785,0.0002778301,0.001635951,0.0001968038,0.0002148867],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001935452,0.0006496815,0.08488961,0.0004103953,0.0003484926,0.0003841597,0.01238783,0.05511814,0.0002612023,0.3871167,0.13275,0.3254902],"study_design_scores_gemma":[0.001845363,0.00008627446,0.004701028,0.0004853024,0.00003751466,0.000003821611,0.001098108,0.9036889,0.0004308192,0.002698963,0.08422186,0.0007020379],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.002025887,0.0003651314,0.7711444,0.1078149,0.003195955,0.0004402601,0.000005025405,0.0001431705,0.1148653],"genre_scores_gemma":[0.8042176,0.0002670024,0.06331044,0.01169341,0.0001762558,0.00002096021,0.000003672536,0.00003522636,0.1202755],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.8485708,"threshold_uncertainty_score":0.9999965,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02351066552657653,"score_gpt":0.3065163120798018,"score_spread":0.2830056465532253,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}