{"id":"W3202359992","doi":"10.1145/3475716.3475790","title":"Continuous Software Bug Prediction","year":2021,"lang":"en","type":"article","venue":"","topic":"Software Engineering Research","field":"Computer Science","cited_by":17,"is_retracted":false,"has_abstract":true,"ca_institutions":"York University","funders":"","keywords":"Benchmark (surveying); Computer science; Software bug; Software; Software regression; Set (abstract data type); Data mining; Verification and validation; Software metric; Software development; Software evolution; Software engineering; Machine learning; Software quality; Software construction; Programming language; Engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0001211907,0.00005685147,0.00006868049,0.00004560255,0.00004182236,0.0001227638,0.0003261584,0.00003636571,0.0001084448],"category_scores_gemma":[0.0008005566,0.00005496506,0.00003085713,0.0003621956,0.00001048005,0.000217921,0.0002229196,0.000101614,0.0001747948],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00003100379,"about_ca_system_score_gemma":0.0000831954,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000007750679,"about_ca_topic_score_gemma":0.000001819735,"domain_scores_codex":[0.9991944,0.00002043096,0.00008711173,0.0002437883,0.0002572792,0.0001969296],"domain_scores_gemma":[0.9990461,0.000270785,0.00000867504,0.0004540241,0.0001455926,0.00007485255],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.000005885003,0.0003157572,0.4457918,0.0001165217,0.0001198505,0.001119764,0.0009759613,0.001898789,0.007698555,0.04533398,0.1301693,0.3664538],"study_design_scores_gemma":[0.001616913,0.0002715186,0.6595282,0.0001026238,0.00001120494,0.0007398742,0.00009381802,0.06586568,0.1068441,0.005774976,0.1582603,0.0008907943],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01811787,0.000140902,0.9787523,0.0003829031,0.0004665785,0.00004299641,0.000001521462,0.001118071,0.0009769351],"genre_scores_gemma":[0.664434,0.00001979481,0.3221337,0.0002961447,0.0001677941,0.00002432095,0.000007859115,0.00001723299,0.01289921],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.6566185,"threshold_uncertainty_score":0.2246692,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0119914838602326,"score_gpt":0.2371583598666829,"score_spread":0.2251668760064503,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}