{"id":"W3163597827","doi":"10.1109/icse43902.2021.00019","title":"Studying Test Annotation Maintenance in the Wild","year":2021,"lang":"en","type":"article","venue":"","topic":"Software Testing and Debugging Techniques","field":"Computer Science","cited_by":20,"is_retracted":false,"has_abstract":true,"ca_institutions":"Concordia University","funders":"","keywords":"Annotation; Computer science; Java; Fixture; Test (biology); Empirical research; Test case; Software engineering; Artificial intelligence; Machine learning; Programming language; Engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02026747,0.0005844491,0.0007529025,0.007752096,0.001766833,0.002992032,0.002978957,0.001872072,0.0007215335],"category_scores_gemma":[0.1773022,0.00085025,0.0005349154,0.00756255,0.002423894,0.007044217,0.002094017,0.002106804,0.0003058454],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002179085,"about_ca_system_score_gemma":0.00206675,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008405355,"about_ca_topic_score_gemma":0.01250486,"domain_scores_codex":[0.9768859,0.007797936,0.002062768,0.005174655,0.006877748,0.001201054],"domain_scores_gemma":[0.686715,0.2154246,0.04045581,0.03369614,0.02103228,0.002676153],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0003948669,0.0006842504,0.6377293,0.0008291848,0.0001921594,0.001911459,0.01827651,0.005247846,0.01258535,0.006349595,0.006842197,0.3089573],"study_design_scores_gemma":[0.0001200028,0.0009957324,0.7746435,0.001295075,0.0003593092,0.005830741,0.02124136,0.1017274,0.02647031,0.01676525,0.05024765,0.0003037329],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9588245,0.001997661,0.03378554,0.001567924,0.0001035116,0.0001135366,0.0008530762,0.001059468,0.001694683],"genre_scores_gemma":[0.9491662,0.0006938736,0.04533857,0.0003872444,0.00006596197,0.0001587436,0.00267852,0.000555183,0.0009557874],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02026747,"threshold_uncertainty_score":0.1071859,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03117131848671664,"score_gpt":0.2705429677314099,"score_spread":0.2393716492446933,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}