{"id":"W4411337211","doi":"10.1109/sp61157.2025.00191","title":"SV-TrustEval-C: Evaluating Structure and Semantic Reasoning in Large Language Models for Source Code Vulnerability Analysis","year":2025,"lang":"en","type":"article","venue":"","topic":"Software Reliability and Analysis Research","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"ca_institutions":"Open Text (Canada); University of Ottawa","funders":"","keywords":"Computer science; Programming language; Natural language processing; Code (set theory); Source code; Artificial intelligence; Set (abstract data type)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005082163,0.002392108,0.000620787,0.004214923,0.001249259,0.00241198,0.003374158,0.002364878,0.00244477],"category_scores_gemma":[0.0395468,0.0006760339,0.001759321,0.002788763,0.001530319,0.003943867,0.003708498,0.00275438,0.001642033],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002766263,"about_ca_system_score_gemma":0.003722209,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.03021443,"about_ca_topic_score_gemma":0.04520961,"domain_scores_codex":[0.9934863,0.002292977,0.0006589763,0.001313867,0.001845512,0.0004023968],"domain_scores_gemma":[0.9743915,0.01459391,0.001735561,0.005635653,0.002956723,0.0006866499],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.002678733,0.001930762,0.09042791,0.004045013,0.0012231,0.00105015,0.001691975,0.2544535,0.008636774,0.02526646,0.4273466,0.1812489],"study_design_scores_gemma":[0.0005597275,0.000491365,0.01533901,0.0003984664,0.0001777532,0.0006345781,0.0006653838,0.8639749,0.01668204,0.0250279,0.07589953,0.0001493676],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.5224695,0.003926381,0.1046012,0.003212062,0.0006912168,0.001319377,0.2138223,0.1325653,0.01739263],"genre_scores_gemma":[0.4312565,0.0006820689,0.1445653,0.0007858996,0.00007249152,0.0009749839,0.414028,0.004567111,0.003067585],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.03021443,"threshold_uncertainty_score":0.06007713,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02268102776703042,"score_gpt":0.3626329116289783,"score_spread":0.3399518838619479,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}