{"id":"W7046825685","doi":"","title":"Evaluating Deep Learning-based Vulnerability Detection Models on Realistic Datasets","year":2023,"lang":"en","type":"dissertation","venue":"UWSpace (University of Waterloo)","topic":"Magnetic confinement fusion research","field":"Physics and Astronomy","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Blackberry (Canada)","funders":"","keywords":"Vulnerability (computing); Software; Source code; Code (set theory); Vulnerability assessment; Software bug","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005973695,0.003520346,0.001033903,0.002835314,0.0006615446,0.001549008,0.002653054,0.002141471,0.001019776],"category_scores_gemma":[0.01750409,0.0006456403,0.001483651,0.00210297,0.001047701,0.003387528,0.001944549,0.002721746,0.0008775677],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002910722,"about_ca_system_score_gemma":0.001619004,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.02389587,"about_ca_topic_score_gemma":0.02949372,"domain_scores_codex":[0.996743,0.001000718,0.0003163087,0.0009876172,0.0006946184,0.0002577215],"domain_scores_gemma":[0.9911848,0.00546245,0.000654009,0.00112122,0.001275449,0.0003021462],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0007692277,0.001192204,0.03158459,0.001027899,0.0008678611,0.0003085438,0.0001954496,0.7359773,0.004944949,0.00250194,0.03301414,0.187616],"study_design_scores_gemma":[0.00006112344,0.0003051518,0.00314074,0.000102581,0.00006454445,0.00009710786,0.00009655848,0.9855822,0.006314399,0.001586635,0.002615764,0.00003318363],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8948211,0.007209829,0.05662043,0.002466321,0.0007022013,0.0005444452,0.01732074,0.01294701,0.007367918],"genre_scores_gemma":[0.8378785,0.002059074,0.090895,0.001026271,0.000136614,0.0003903096,0.06359436,0.0003641741,0.003655633],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02389587,"threshold_uncertainty_score":0.04751354,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03402689191305869,"score_gpt":0.2928547152600682,"score_spread":0.2588278233470095,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}