{"id":"W4403604523","doi":"10.1145/3672448","title":"Understanding Test Convention Consistency as a Dimension of Test Quality","year":2024,"lang":"en","type":"article","venue":"ACM Transactions on Software Engineering and Methodology","topic":"Software Engineering Research","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Test (biology); Consistency (knowledge bases); Dimension (graph theory); Quality (philosophy); Reliability engineering; Artificial intelligence; Mathematics; Engineering","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.03141218,0.0009803295,0.001002445,0.006927469,0.0008674419,0.007045798,0.001872129,0.001683467,0.0009837581],"category_scores_gemma":[0.2378115,0.0007444669,0.001102927,0.005445601,0.004675891,0.01315305,0.003319289,0.003567203,0.0001471649],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0024481,"about_ca_system_score_gemma":0.003176411,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004826125,"about_ca_topic_score_gemma":0.002919393,"domain_scores_codex":[0.9526716,0.01998587,0.005214783,0.004211188,0.01619134,0.001725288],"domain_scores_gemma":[0.6156456,0.2712189,0.03962812,0.03777708,0.03290538,0.002824847],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0005151683,0.0004487849,0.5132155,0.000671176,0.0004798431,0.0004797493,0.008555736,0.05938972,0.01757062,0.1426589,0.002305143,0.2537096],"study_design_scores_gemma":[0.0001888183,0.001798061,0.3276601,0.0008104094,0.0004621371,0.001611645,0.005584556,0.3100977,0.0244578,0.3114398,0.01547163,0.0004173401],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.5015908,0.001588624,0.4844935,0.003079431,0.0000860504,0.0002132382,0.000444032,0.001212835,0.007291594],"genre_scores_gemma":[0.9078966,0.0001956924,0.09062272,0.0002437538,0.00006034838,0.0001357505,0.0003832613,0.0001861984,0.0002755539],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9685878,"threshold_uncertainty_score":0.1661255,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2278846789678397,"score_gpt":0.37761842431744,"score_spread":0.1497337453496004,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}