{"id":"W4414589104","doi":"10.1007/s10664-025-10717-y","title":"Towards understanding the impact of data bugs on deep learning models in software engineering","year":2025,"lang":"en","type":"article","venue":"Empirical Software Engineering","topic":"Software Engineering Research","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"ca_institutions":"Polytechnique Montréal; Dalhousie University","funders":"","keywords":"Deep learning; Overfitting; Generalizability theory; Data pre-processing; Software quality; Leverage (statistics); Preprocessor; Metric (unit); Software bug; Software","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009754561,0.0009840745,0.0009062155,0.001304418,0.0005024909,0.003101858,0.001610428,0.001975525,0.002420982],"category_scores_gemma":[0.1241801,0.0009329892,0.0005857886,0.001111205,0.001605581,0.01061255,0.002405166,0.005790864,0.0002627426],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002450487,"about_ca_system_score_gemma":0.002107834,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01129358,"about_ca_topic_score_gemma":0.01194753,"domain_scores_codex":[0.996784,0.001676404,0.0001839583,0.0004428952,0.0006351525,0.0002776377],"domain_scores_gemma":[0.8846455,0.09872138,0.0051708,0.005154381,0.005342087,0.0009657761],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"observational","study_design_scores_codex":[0.0004361112,0.0003759614,0.03537994,0.0002871477,0.0001876578,0.0001299755,0.0003825122,0.7907699,0.002290582,0.05901787,0.003078069,0.1076642],"study_design_scores_gemma":[0.000005153065,0.00001882788,0.0006075088,0.00001965234,0.00001089082,0.000006720063,0.00002286309,0.9741416,0.0003938487,0.02464718,0.0001212574,0.000004503486],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.449747,0.002828713,0.5333462,0.008423022,0.0002009618,0.00005858683,0.0004070438,0.001048957,0.003939545],"genre_scores_gemma":[0.9653669,0.0005115622,0.03231659,0.0003120078,0.00007475136,0.00002676889,0.0002349541,0.0001422572,0.00101416],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01129358,"threshold_uncertainty_score":0.05158764,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.09277203969085854,"score_gpt":0.3420305939016809,"score_spread":0.2492585542108224,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}