{"id":"W3093046707","doi":"10.1007/s10515-020-00277-4","title":"Understanding machine learning software defect predictions","year":2020,"lang":"en","type":"article","venue":"Automated Software Engineering","topic":"Software Engineering Research","field":"Computer Science","cited_by":98,"is_retracted":false,"has_abstract":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Computer science; Exploit; Machine learning; Software bug; Software; Artificial intelligence; Boosting (machine learning); Source code; Set (abstract data type); Data mining; Principal (computer security); Decision tree; Predictive modelling; Programming language","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001034471,0.0005113644,0.0003845935,0.001102581,0.000354617,0.001524411,0.000988652,0.0009877929,0.001842271],"category_scores_gemma":[0.0117799,0.0003167433,0.0003786038,0.0006014045,0.0004449045,0.003810059,0.000682489,0.001338361,0.0004816321],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007232684,"about_ca_system_score_gemma":0.0006548155,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00379912,"about_ca_topic_score_gemma":0.004116219,"domain_scores_codex":[0.9995121,0.0001478691,0.00003317693,0.0001085923,0.000147078,0.00005131492],"domain_scores_gemma":[0.9941663,0.004427723,0.0003238658,0.0003689728,0.0006523592,0.00006082324],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.00021073,0.0005971022,0.04755505,0.0003588524,0.0001348212,0.0006616471,0.0008998332,0.3025423,0.009574272,0.1038142,0.01606901,0.5175823],"study_design_scores_gemma":[0.000004469814,0.00002102992,0.001610978,0.00002100304,0.00001389518,0.00005096237,0.00009547794,0.9198642,0.002065122,0.07461838,0.00162935,0.000005067805],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3721045,0.001069044,0.6119131,0.003612833,0.0001009327,0.00007930888,0.0009391448,0.002364038,0.007817058],"genre_scores_gemma":[0.9458072,0.000338745,0.05056746,0.0001612805,0.00006580776,0.00003769566,0.001059747,0.00008265714,0.001879433],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.00379912,"threshold_uncertainty_score":0.007553995,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04516996975354468,"score_gpt":0.2432856168383505,"score_spread":0.1981156470848059,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}