{"id":"W4414093251","doi":"10.3390/make7030097","title":"A Review of Large Language Models for Automated Test Case Generation","year":2025,"lang":"en","type":"review","venue":"Machine Learning and Knowledge Extraction","topic":"Software Testing and Debugging Techniques","field":"Computer Science","cited_by":10,"is_retracted":false,"has_abstract":true,"ca_institutions":"Ontario Tech University","funders":"","keywords":"Test (biology); Natural language generation; Natural language; Focus (optics); Software; Test case","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005450453,0.001674215,0.002015623,0.009180949,0.000431183,0.001729301,0.002586069,0.001511904,0.005492438],"category_scores_gemma":[0.0232448,0.0009896924,0.002546456,0.008276055,0.0006627603,0.002770117,0.001151273,0.001370236,0.002347615],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001642625,"about_ca_system_score_gemma":0.005986822,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004848763,"about_ca_topic_score_gemma":0.007352453,"domain_scores_codex":[0.9967181,0.001130211,0.0007648747,0.0003212233,0.0009795275,0.00008604234],"domain_scores_gemma":[0.9754411,0.02029307,0.00133685,0.0005224252,0.002246443,0.0001600931],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.00007015371,0.00007878715,0.0003899224,0.09907699,0.000270353,0.0001464452,0.0001924858,0.001967359,0.0007962887,0.004041777,0.01446578,0.8785036],"study_design_scores_gemma":[0.00006334857,0.0003633361,0.002806632,0.1358625,0.002264207,0.001547422,0.0002646244,0.002977339,0.002347689,0.007150427,0.8442238,0.0001286993],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"review","genre_gemma":"review","genre_scores_codex":[0.0003439214,0.9913185,0.005605451,0.0003982953,0.0001399614,0.0001185412,0.0002256113,0.0001098005,0.001739968],"genre_scores_gemma":[0.003513429,0.9855099,0.009345259,0.0003438711,0.00009093359,0.0002353365,0.0004828947,0.00003908633,0.0004392358],"genre_candidate":"review","genre_consensus":"review","teacher_disagreement_score":0.009180949,"threshold_uncertainty_score":0.0288251,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04220589820370538,"score_gpt":0.4041485293505684,"score_spread":0.361942631146863,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}