{"id":"W4411505879","doi":"10.1145/3729176.3729200","title":"A Case Study Investigating the Role of Generative AI in Quality Evaluations of Epics in Agile Software Development","year":2025,"lang":"en","type":"article","venue":"","topic":"Software Engineering Techniques and Practices","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":false,"ca_institutions":"IBM (Canada)","funders":"","keywords":"Agile software development; Computer science; Software quality; Software engineering; Software development; Quality (philosophy); Software; Programming language","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01999114,0.000414069,0.0003129806,0.001834311,0.003628285,0.003200735,0.001603166,0.001853413,0.00213812],"category_scores_gemma":[0.06101385,0.0003724922,0.0003984149,0.00149786,0.002877201,0.003057362,0.002831168,0.001824819,0.0002520398],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003403707,"about_ca_system_score_gemma":0.002419681,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004468567,"about_ca_topic_score_gemma":0.009734596,"domain_scores_codex":[0.9811798,0.01430392,0.0005859651,0.0006045976,0.002515061,0.0008106056],"domain_scores_gemma":[0.8743671,0.09811085,0.005841866,0.006637961,0.01083277,0.004209486],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"qualitative","study_design_scores_codex":[0.002281001,0.01006663,0.1375741,0.001263527,0.0001528971,0.01646209,0.5169749,0.007635533,0.01624061,0.03606601,0.003984135,0.2512986],"study_design_scores_gemma":[0.001079363,0.01890396,0.193045,0.001784548,0.0004713361,0.01480201,0.5691489,0.07170121,0.03290579,0.02000027,0.07575906,0.0003984402],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9819358,0.0001145642,0.008089801,0.000519881,0.00002056138,0.0002586429,0.00001808149,0.00004672855,0.008995911],"genre_scores_gemma":[0.9915531,0.00005477306,0.006856435,0.00007357873,0.000005545209,0.00006061125,0.0000145199,0.00001743727,0.001363945],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01999114,"threshold_uncertainty_score":0.1057245,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06305782420443068,"score_gpt":0.3873828332371154,"score_spread":0.3243250090326847,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}