{"id":"W4411271577","doi":"10.1109/msr66628.2025.00022","title":"Revisiting Defects4J for Fault Localization in Diverse Development Scenarios","year":2025,"lang":"en","type":"article","venue":"","topic":"Software Testing and Debugging Techniques","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta; Concordia University","funders":"","keywords":"Computer science; Fault (geology); Development (topology); Systems engineering; Geology; Engineering; Seismology; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009892588,0.002398904,0.001199314,0.0097625,0.001257364,0.003745684,0.003955576,0.002046321,0.00179847],"category_scores_gemma":[0.05308875,0.0008245913,0.001886729,0.006627433,0.001294205,0.00387432,0.003255447,0.002797983,0.001899565],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002033258,"about_ca_system_score_gemma":0.003044707,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01833352,"about_ca_topic_score_gemma":0.02965713,"domain_scores_codex":[0.9840941,0.003664893,0.002057704,0.00346599,0.005708549,0.001008813],"domain_scores_gemma":[0.9454144,0.02439805,0.00661757,0.0111972,0.01031003,0.002062822],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.002547551,0.002148706,0.2708367,0.00654589,0.001728629,0.001474964,0.001905197,0.0567554,0.03067661,0.007852294,0.3632121,0.254316],"study_design_scores_gemma":[0.001806299,0.003621123,0.3416996,0.001433366,0.0009575321,0.003084276,0.002139054,0.3083065,0.03988186,0.01955723,0.2768385,0.0006745599],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.6486614,0.008144978,0.05118619,0.002849216,0.001324157,0.0008171786,0.2023698,0.07290682,0.01174032],"genre_scores_gemma":[0.3979253,0.001025819,0.09766334,0.0009438985,0.0002124049,0.0007410302,0.4929195,0.005934549,0.002634175],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01833352,"threshold_uncertainty_score":0.05231762,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02350747080520064,"score_gpt":0.2886050368149066,"score_spread":0.265097566009706,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}