{"id":"W4407551092","doi":"10.1007/s10664-025-10614-4","title":"Bugs in large language models generated code: an empirical study","year":2025,"lang":"en","type":"article","venue":"Empirical Software Engineering","topic":"Advanced Malware Detection Techniques","field":"Computer Science","cited_by":44,"is_retracted":false,"has_abstract":false,"ca_institutions":"Polytechnique Montréal","funders":"Fonds de recherche du Québec; Natural Sciences and Engineering Research Council of Canada; Consortium de Recherche et d’innovation en Aérospatiale au Québec; Canadian Institute for Advanced Research","keywords":"Computer science; Programming language; Empirical research; Code (set theory); Statistics; Mathematics","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003413776,0.000452118,0.0002348206,0.001637018,0.0005232767,0.0007353479,0.0009745678,0.0009871216,0.001480694],"category_scores_gemma":[0.09193002,0.0003654459,0.0003807407,0.00105916,0.001358622,0.001678564,0.0006738809,0.001335501,0.0003576337],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007042586,"about_ca_system_score_gemma":0.0005988066,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002265798,"about_ca_topic_score_gemma":0.003061596,"domain_scores_codex":[0.9963472,0.00163183,0.0002567779,0.0004820527,0.001137068,0.0001450633],"domain_scores_gemma":[0.7384771,0.2229215,0.01813809,0.009292171,0.01007248,0.001098728],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00189632,0.009793608,0.8499866,0.0005033607,0.0002170903,0.001612304,0.006021075,0.02090048,0.01065482,0.002608618,0.003226934,0.09257881],"study_design_scores_gemma":[0.0005175134,0.007370322,0.7030223,0.0003275372,0.0003580883,0.006647916,0.004899685,0.2476327,0.01977598,0.00504439,0.004236826,0.0001667559],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9985887,0.00005254705,0.0009274746,0.00003682497,0.00000265776,0.0000221265,0.00007989356,0.00005074534,0.0002390093],"genre_scores_gemma":[0.998489,0.00004150765,0.0008973554,0.00002624364,0.000005261437,0.00002342398,0.0002691211,0.00003221236,0.0002158059],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.003413776,"threshold_uncertainty_score":0.01805401,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01986234801095843,"score_gpt":0.3267766397706522,"score_spread":0.3069142917596938,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}