{"id":"W4400351643","doi":"10.1109/tse.2024.3423712","title":"Revisiting the Performance of Deep Learning-Based Vulnerability Detection on Realistic Datasets","year":2024,"lang":"en","type":"article","venue":"IEEE Transactions on Software Engineering","topic":"Network Security and Intrusion Detection","field":"Computer Science","cited_by":16,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Vulnerability (computing); Artificial intelligence; Deep learning; Data science; Machine learning; Computer security","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007428432,0.003094385,0.001235988,0.002778263,0.0008156318,0.00231976,0.002658221,0.002536463,0.001241042],"category_scores_gemma":[0.02350611,0.0005945559,0.001258454,0.00186689,0.001052841,0.003714301,0.002249715,0.003125929,0.001275898],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002561884,"about_ca_system_score_gemma":0.001711248,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0303975,"about_ca_topic_score_gemma":0.02733834,"domain_scores_codex":[0.9962971,0.001212904,0.0003446104,0.001066993,0.0007174973,0.0003608546],"domain_scores_gemma":[0.9915009,0.005117729,0.0004910986,0.001402788,0.001229144,0.0002583283],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"observational","study_design_scores_codex":[0.000985712,0.001046764,0.0519693,0.00103495,0.0009617922,0.000341583,0.0002877647,0.6052176,0.006824781,0.002331615,0.04420459,0.2847936],"study_design_scores_gemma":[0.00004255086,0.000283153,0.00558579,0.0001184468,0.00006115694,0.000128878,0.0001248128,0.9796125,0.007233077,0.002530022,0.00423648,0.00004319979],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8545731,0.01262279,0.08196401,0.005118963,0.001031987,0.0004007528,0.01848553,0.01566294,0.01013996],"genre_scores_gemma":[0.9044948,0.001304548,0.05080328,0.0009065322,0.000113811,0.0001747776,0.03878803,0.0003191917,0.00309498],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.0303975,"threshold_uncertainty_score":0.06044114,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.009199555430048047,"score_gpt":0.2236496439675864,"score_spread":0.2144500885375384,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}