{"id":"W6950499523","doi":"10.5281/zenodo.8206635","title":"Revisiting the Performance of Deep Learning-Based Vulnerability Detection on Realistic Datasets","year":2024,"lang":"en","type":"article","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Adversarial Robustness in Machine Learning","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"","keywords":"Vulnerability (computing); Deep learning; Scripting language; Field (mathematics); Pattern recognition (psychology)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["sts"],"consensus_categories":[],"category_scores_codex":[0.002021661,0.0001177055,0.0001113298,0.0001656629,0.001912711,0.0006947886,0.001351242,0.00004129914,0.0005922697],"category_scores_gemma":[0.001847934,0.00009726333,0.00004571249,0.0008320984,0.0001310396,0.0003458231,0.0008029087,0.0006264079,0.0007490462],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000128051,"about_ca_system_score_gemma":0.000004959998,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00001361022,"about_ca_topic_score_gemma":1.57465e-7,"domain_scores_codex":[0.9978503,0.0008167546,0.0002455633,0.0004329272,0.0004155982,0.0002388476],"domain_scores_gemma":[0.9987662,0.0002206501,0.0001069073,0.0006425657,0.0002018401,0.00006182164],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00004986888,0.00002452958,0.000007665697,0.0002287773,0.00001896045,0.000009627853,0.0005596195,0.1579226,0.001004678,0.005666642,0.0007236789,0.8337833],"study_design_scores_gemma":[0.0001220526,0.0002089929,0.0007202395,0.00008477967,0.000008972678,0.00002641046,0.00003577125,0.8051463,0.0009544353,0.00006555689,0.1925211,0.0001054032],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02416295,0.00008330393,0.9644533,0.001217618,0.000255688,0.0003327113,0.00004546941,0.001410869,0.008038028],"genre_scores_gemma":[0.9985706,0.00001180351,0.0006111586,0.0000501984,0.0001528534,5.23331e-8,0.0002922733,0.0002718814,0.00003914289],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9744077,"threshold_uncertainty_score":0.9993867,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02343312981353438,"score_gpt":0.2678055181972334,"score_spread":0.244372388383699,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}