{"id":"W7125633080","doi":"10.1109/cascon66301.2025.00098","title":"A Preliminary Systematic Review on LLM-Based System Assurance: Is Generative AI All You Need?","year":2025,"lang":"","type":"article","venue":"","topic":"Adversarial Robustness in Machine Learning","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"ca_institutions":"York University","funders":"","keywords":"Feature (linguistics); Generative grammar; Matching (statistics); Set (abstract data type); Generative model","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.003483678,0.001227008,0.002916673,0.0005847171,0.0007810658,0.0007701069,0.003370105,0.0004334407,0.0001981215],"category_scores_gemma":[0.001701111,0.001025199,0.0007569591,0.002619023,0.0001821553,0.0007703298,0.0009297988,0.001428736,0.0007065181],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001020814,"about_ca_system_score_gemma":0.0013254,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00009812194,"about_ca_topic_score_gemma":0.000005147176,"domain_scores_codex":[0.9889459,0.003492438,0.002628927,0.002167294,0.001623319,0.001142149],"domain_scores_gemma":[0.9923571,0.001714039,0.001286521,0.003535464,0.0007897055,0.0003172207],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"systematic_review","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001130569,0.0003865782,0.00003694306,0.8381,0.0006819225,0.0001871466,0.001084663,0.08131047,0.00001570563,0.05084522,0.02646579,0.0007725116],"study_design_scores_gemma":[0.0007624459,0.0005456064,0.00001400674,0.3602865,0.0009892517,0.00002085808,0.00020646,0.6359911,0.0002168069,0.00004618714,0.000297672,0.0006231357],"study_design_candidate":"systematic_review","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.00003463383,0.04389579,0.9004837,0.03190622,0.003382045,0.005984969,0.00001584893,0.0005997591,0.01369708],"genre_scores_gemma":[0.7048293,0.00235224,0.06719727,0.1908159,0.0006240685,0.001899362,0.00003471505,0.0001999308,0.03204717],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.8332864,"threshold_uncertainty_score":0.9992198,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01589815804446718,"score_gpt":0.2960974876600271,"score_spread":0.2801993296155599,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}