{"id":"W4376606868","doi":"10.1109/saner56733.2023.00077","title":"JTestMigBench and JTestMigTax: A benchmark and taxonomy for unit test migration","year":2023,"lang":"en","type":"article","venue":"","topic":"Software Engineering Research","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Unit testing; Computer science; Reuse; Benchmark (surveying); Software engineering; Code (set theory); Taxonomy (biology); Code coverage; Test case; Code reuse; Scratch; Software; Software quality; Test (biology); Programming language; Machine learning; Software development; Engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009135823,0.001843454,0.0007633312,0.009243351,0.002270613,0.002843117,0.003526745,0.002303447,0.001972831],"category_scores_gemma":[0.05855082,0.001034891,0.001378987,0.009549382,0.001780428,0.004636799,0.002855158,0.002765302,0.001143334],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002372237,"about_ca_system_score_gemma":0.004478341,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.009503453,"about_ca_topic_score_gemma":0.01537752,"domain_scores_codex":[0.985279,0.003610091,0.002559564,0.001688717,0.005792067,0.001070615],"domain_scores_gemma":[0.946829,0.02038717,0.008146055,0.009553887,0.01268245,0.002401402],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.00161654,0.001908092,0.1222701,0.007144183,0.0003864966,0.001483488,0.009383958,0.0261172,0.04123454,0.03600762,0.07355224,0.6788955],"study_design_scores_gemma":[0.000655498,0.005231391,0.181931,0.005471949,0.0005517262,0.008598842,0.007811684,0.1804053,0.08594944,0.05391368,0.4686428,0.0008366582],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.4242675,0.01154888,0.4430845,0.004059365,0.0008320162,0.004421914,0.01449533,0.0578708,0.03941984],"genre_scores_gemma":[0.3526734,0.003167372,0.5869903,0.001052608,0.00014044,0.002977296,0.0370001,0.007895435,0.008103095],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.009503453,"threshold_uncertainty_score":0.04831547,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04112854843615728,"score_gpt":0.2681504518067819,"score_spread":0.2270219033706246,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}