{"id":"W4414589104","doi":"10.1007/s10664-025-10717-y","title":"Towards understanding the impact of data bugs on deep learning models in software engineering","year":2025,"lang":"en","type":"article","venue":"Empirical Software Engineering","topic":"Software Engineering Research","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"ca_institutions":"Polytechnique Montréal; Dalhousie University","funders":"","keywords":"Deep learning; Overfitting; Generalizability theory; Data pre-processing; Software quality; Leverage (statistics); Preprocessor; Metric (unit); Software bug; Software","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.001131837,0.0004625293,0.0005322708,0.0008392753,0.0001237462,0.0002002706,0.003099478,0.0002116235,0.00001151887],"category_scores_gemma":[0.007969806,0.0003758424,0.0002004585,0.002696023,0.00004503752,0.0008935893,0.001592602,0.001338254,0.000008170665],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001083309,"about_ca_system_score_gemma":0.0002510791,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001279906,"about_ca_topic_score_gemma":0.00000414792,"domain_scores_codex":[0.9968323,0.00007840637,0.0005893702,0.0008424764,0.0007165012,0.0009409618],"domain_scores_gemma":[0.9933135,0.004657793,0.00007791749,0.001681869,0.00008579233,0.0001831439],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00001141875,0.00005121539,0.04657942,0.0001066677,0.00008944044,0.00002718457,0.0004451782,0.9478329,0.00003557518,0.001237607,0.0001858348,0.00339759],"study_design_scores_gemma":[0.0004261997,0.0001053826,0.09214449,0.0003675938,0.000008953152,0.000009013921,0.00002528244,0.9055998,0.00009920617,0.0006802017,0.0001604745,0.0003733898],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.06064687,0.0006010526,0.9369383,0.000159868,0.0003064011,0.0002936871,0.00000945866,0.001010586,0.00003376151],"genre_scores_gemma":[0.9484776,0.00003122827,0.05124502,0.00003484089,0.00006734216,0.00003684526,0.00001600272,0.0000612369,0.00002989982],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.8878307,"threshold_uncertainty_score":0.9998693,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.09277203969085854,"score_gpt":0.3420305939016809,"score_spread":0.2492585542108224,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}