{"id":"W3194585484","doi":"10.1145/3468264.3468609","title":"How disabled tests manifest in test maintainability challenges?","year":2021,"lang":"en","type":"article","venue":"","topic":"Software Engineering Research","field":"Computer Science","cited_by":9,"is_retracted":false,"has_abstract":true,"ca_institutions":"Concordia University","funders":"","keywords":"Technical debt; Software maintenance; Computer science; Test (biology); Maintainability; Software engineering; Code smell; Quality (philosophy); Empirical research; Reliability engineering; Risk analysis (engineering); Java; Codebase; Software quality; Software; Software development; Engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.000457377,0.0001183421,0.0001454216,0.00008618964,0.00003557715,0.0002399908,0.0006796026,0.00006002582,0.00002852766],"category_scores_gemma":[0.005519245,0.0001129201,0.0000371724,0.0006318224,0.00003363835,0.0003949307,0.000536891,0.0002171591,0.00004754227],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001808644,"about_ca_system_score_gemma":0.0001592683,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00002292095,"about_ca_topic_score_gemma":0.0002676977,"domain_scores_codex":[0.9985319,0.00006064989,0.000124828,0.0005210896,0.0003193398,0.0004422285],"domain_scores_gemma":[0.9969417,0.001809432,0.00001409773,0.0009797165,0.0001331214,0.0001219635],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.000003388761,0.001054236,0.6546711,0.0003333874,0.0000171469,0.002533999,0.0007913242,0.0002195867,0.001653946,0.2723509,0.0007502852,0.06562078],"study_design_scores_gemma":[0.0003785647,0.00006606821,0.9783337,0.00003045014,8.344012e-7,0.00008858105,0.0001529539,0.006934761,0.002505429,0.009017091,0.002232647,0.0002589949],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.4872963,0.002576,0.3382997,0.1438589,0.00101929,0.0010686,0.000005122894,0.002827876,0.02304832],"genre_scores_gemma":[0.981533,0.00005080639,0.01656495,0.00005348586,0.00003769613,0.00003092952,9.48182e-7,0.00001004064,0.00171818],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.4942367,"threshold_uncertainty_score":0.6607451,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02653790395737383,"score_gpt":0.266220740506306,"score_spread":0.2396828365489321,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}