{"id":"W4411440374","doi":"10.1007/s10664-025-10661-x","title":"Supporting multi-dimensional unit test classification","year":2025,"lang":"en","type":"article","venue":"Empirical Software Engineering","topic":"Software Testing and Debugging Techniques","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"","keywords":"Computer science; Unit testing; Test (biology); Unit (ring theory); Artificial intelligence; Pattern recognition (psychology); Geology; Psychology; Operating system; Mathematics education","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005947093,0.001420308,0.002000832,0.006860353,0.0009260309,0.003192547,0.003419576,0.002032578,0.001211866],"category_scores_gemma":[0.04001339,0.0004591986,0.001497241,0.005032581,0.000911596,0.00359712,0.002655753,0.002146809,0.001114146],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001249772,"about_ca_system_score_gemma":0.001921264,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005878917,"about_ca_topic_score_gemma":0.01080994,"domain_scores_codex":[0.9909928,0.001449867,0.001520405,0.002250161,0.003304785,0.0004819863],"domain_scores_gemma":[0.9536567,0.02292629,0.005153484,0.008529459,0.008679735,0.001054351],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.0007978002,0.000964632,0.143866,0.0007458571,0.000261658,0.00076711,0.0008891599,0.03793439,0.01958135,0.004302944,0.01472728,0.7751617],"study_design_scores_gemma":[0.00006356014,0.0001819047,0.01806763,0.0001009688,0.00008555252,0.0005917706,0.0003850374,0.9374019,0.02337494,0.01364635,0.006027699,0.00007269984],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2742952,0.001407177,0.6889569,0.0008348183,0.00017896,0.0005792014,0.008179392,0.02247029,0.003098093],"genre_scores_gemma":[0.5206039,0.0002100652,0.4582693,0.0002976146,0.00008332834,0.0003351833,0.01858944,0.0005689745,0.001042278],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006860353,"threshold_uncertainty_score":0.03145164,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04423106979949689,"score_gpt":0.3406725485906861,"score_spread":0.2964414787911893,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}