{"id":"W4281811500","doi":"10.1007/s10664-022-10153-2","title":"Works for Me! Cannot Reproduce – A Large Scale Empirical Study of Non-reproducible Bugs","year":2022,"lang":"en","type":"article","venue":"Empirical Software Engineering","topic":"Software Engineering Research","field":"Computer Science","cited_by":11,"is_retracted":false,"has_abstract":false,"ca_institutions":"Polytechnique Montréal; Dalhousie University","funders":"","keywords":"Software bug; Computer science; Empirical research; Software; Debugging; Eclipse; Software regression; Software engineering; Data science; Software development; Software quality; Programming language; Statistics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.01327792,0.0005016173,0.0005506806,0.001769731,0.002002824,0.002547783,0.001845943,0.002559889,0.01009853],"category_scores_gemma":[0.185884,0.0006907129,0.000652021,0.002076084,0.004416881,0.006267766,0.00256245,0.002904385,0.004457865],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007955317,"about_ca_system_score_gemma":0.001560508,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002174492,"about_ca_topic_score_gemma":0.0028117,"domain_scores_codex":[0.9907906,0.003922503,0.0005556362,0.001455543,0.002926378,0.0003493561],"domain_scores_gemma":[0.7262294,0.1439833,0.03281652,0.07545397,0.01683019,0.004686578],"domain_codex":null,"domain_gemma":"reproducibility","domain_candidate":"reproducibility","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.001018145,0.001660449,0.6395112,0.001340607,0.0009228447,0.001575051,0.02051782,0.003056685,0.005614141,0.04858618,0.05541445,0.2207825],"study_design_scores_gemma":[0.0005155413,0.002654776,0.7123674,0.001637989,0.0005348653,0.004049852,0.02343661,0.009988741,0.005254822,0.1193135,0.1198994,0.000346518],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9452003,0.001615394,0.01406222,0.01515244,0.0004188646,0.0001827723,0.001314509,0.0005859067,0.02146765],"genre_scores_gemma":[0.9885319,0.0003143873,0.003127744,0.002137383,0.0001112302,0.00009122654,0.0006694231,0.0004351922,0.004581512],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9867221,"threshold_uncertainty_score":0.07022119,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03099162961572883,"score_gpt":0.3207328907301085,"score_spread":0.2897412611143796,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}