{"id":"W6950499523","doi":"10.5281/zenodo.8206635","title":"Revisiting the Performance of Deep Learning-Based Vulnerability Detection on Realistic Datasets","year":2024,"lang":"en","type":"article","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Adversarial Robustness in Machine Learning","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"","keywords":"Vulnerability (computing); Deep learning; Scripting language; Field (mathematics); Pattern recognition (psychology)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005433111,0.001394146,0.000748754,0.001752077,0.000596528,0.001602011,0.002014133,0.001370106,0.002754795],"category_scores_gemma":[0.02172222,0.0004545223,0.0009766895,0.001394146,0.001161846,0.001954373,0.001753015,0.002076521,0.00177237],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00177884,"about_ca_system_score_gemma":0.00141684,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007397319,"about_ca_topic_score_gemma":0.007894871,"domain_scores_codex":[0.9952651,0.00150916,0.000359854,0.001092899,0.001395962,0.000376968],"domain_scores_gemma":[0.9895621,0.004702753,0.0006724742,0.003307535,0.001442056,0.0003130679],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.002462435,0.001305729,0.0376191,0.001471436,0.000870927,0.0006758322,0.0002587037,0.3830837,0.0143546,0.008740282,0.3723722,0.1767851],"study_design_scores_gemma":[0.0003425909,0.0006428144,0.02255498,0.0003012746,0.0001233137,0.0007806201,0.0002354759,0.8796324,0.03671999,0.01444025,0.04408185,0.00014453],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.6999618,0.004017802,0.08773381,0.004518874,0.001438961,0.0008551534,0.1443551,0.0409311,0.01618738],"genre_scores_gemma":[0.7113771,0.000731719,0.05736417,0.0008304464,0.0001121513,0.0003345462,0.2242846,0.001384177,0.003581012],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.007397319,"threshold_uncertainty_score":0.02873337,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02343312981353438,"score_gpt":0.2678055181972334,"score_spread":0.244372388383699,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}