{"id":"W7125955600","doi":"10.1109/ase63991.2025.00102","title":"Backdoors in Code Summarizers: How Bad Is It?","year":2025,"lang":"","type":"article","venue":"","topic":"Adversarial Robustness in Machine Learning","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"Ministry of Education","keywords":"Backdoor; Code (set theory); Task (project management); Inference; Automatic summarization; Software","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01433587,0.001599106,0.001443249,0.002224244,0.001469538,0.004061852,0.002090872,0.002583379,0.001753504],"category_scores_gemma":[0.1526904,0.001179383,0.0011773,0.001614226,0.002842361,0.01180338,0.003379056,0.003576229,0.002136488],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001365057,"about_ca_system_score_gemma":0.001961199,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002745005,"about_ca_topic_score_gemma":0.002871967,"domain_scores_codex":[0.9780347,0.009025987,0.001711536,0.004048828,0.006064548,0.001114275],"domain_scores_gemma":[0.8760553,0.0696778,0.01448754,0.03162049,0.006652433,0.00150644],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.003925831,0.0008355575,0.09754688,0.002067842,0.0008254088,0.001308556,0.008908678,0.04912115,0.03211732,0.01154238,0.02871203,0.7630884],"study_design_scores_gemma":[0.000549265,0.007404062,0.06190565,0.002114252,0.00174969,0.005980781,0.009370315,0.5908066,0.1657179,0.07270569,0.0808685,0.0008272591],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.7174645,0.008984788,0.2202011,0.007515414,0.0009374645,0.0007600932,0.002270397,0.03498535,0.006880918],"genre_scores_gemma":[0.9217334,0.001167619,0.06961759,0.001454266,0.0002307569,0.0001440065,0.001831826,0.001483876,0.002336722],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01433587,"threshold_uncertainty_score":0.07581621,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02351066552657653,"score_gpt":0.3065163120798018,"score_spread":0.2830056465532253,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}