{"id":"W4389141459","doi":"10.1007/s10664-023-10389-6","title":"Silent bugs in deep learning frameworks: an empirical study of Keras and TensorFlow","year":2023,"lang":"en","type":"article","venue":"Empirical Software Engineering","topic":"Software Engineering Research","field":"Computer Science","cited_by":38,"is_retracted":false,"has_abstract":false,"ca_institutions":"Polytechnique Montréal","funders":"Fonds de recherche du Québec; Consortium de Recherche et d’innovation en Aérospatiale au Québec; Canadian Institute for Advanced Research","keywords":"Software bug; Computer science; Relevance (law); Debugging; Artificial intelligence; Empirical research; Deep learning; Machine learning; Software; Programming language","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.0170036,0.0006607831,0.0005869774,0.001712385,0.001288919,0.001803833,0.002579601,0.002303426,0.002098378],"category_scores_gemma":[0.22012,0.0006145296,0.0006169563,0.001972186,0.003300077,0.008320617,0.002124851,0.00485606,0.0003303259],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001782899,"about_ca_system_score_gemma":0.002535869,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007722823,"about_ca_topic_score_gemma":0.008376068,"domain_scores_codex":[0.9887192,0.004669697,0.0006874205,0.001401288,0.003613908,0.0009084697],"domain_scores_gemma":[0.6880161,0.2473794,0.02493701,0.02332193,0.01217511,0.004170527],"domain_codex":null,"domain_gemma":"reproducibility","domain_candidate":"reproducibility","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00451304,0.006742817,0.5347843,0.001173796,0.0006179828,0.001056184,0.008186323,0.08544864,0.004896059,0.08509899,0.0199334,0.2475485],"study_design_scores_gemma":[0.0005670531,0.002477652,0.1217281,0.000493963,0.0004384432,0.001256334,0.004256919,0.7412241,0.005717382,0.1147117,0.006912648,0.0002156222],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9842834,0.0008296527,0.0111649,0.0008243346,0.00003913521,0.00004250032,0.0001892297,0.0006543831,0.001972387],"genre_scores_gemma":[0.9958314,0.00008232419,0.003395723,0.00006705879,0.00001263852,0.00001578503,0.0001794431,0.0001133288,0.0003023086],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9829964,"threshold_uncertainty_score":0.08992469,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02542377729338102,"score_gpt":0.3172849195316602,"score_spread":0.2918611422382792,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}