{"id":"W2994598966","doi":"10.1109/icsme.2019.00018","title":"Improving Bug Triaging with High Confidence Predictions at Ericsson","year":2019,"lang":"en","type":"article","venue":"","topic":"Software Engineering Research","field":"Computer Science","cited_by":36,"is_retracted":false,"has_abstract":true,"ca_institutions":"Concordia University","funders":"","keywords":"Computer science; Triage; Software bug; Categorical variable; Context (archaeology); Classifier (UML); Precision and recall; Replicate; Software regression; Machine learning; Artificial intelligence; Data mining; Software; Software quality; Statistics; Software development","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01255539,0.001906268,0.001920953,0.005681797,0.0007083744,0.003284124,0.001966882,0.002213915,0.001426988],"category_scores_gemma":[0.05197346,0.0009514018,0.001085402,0.0032536,0.0005160524,0.002886176,0.002031657,0.002840663,0.003469815],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001531161,"about_ca_system_score_gemma":0.00219385,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01886512,"about_ca_topic_score_gemma":0.01778365,"domain_scores_codex":[0.9924343,0.002327412,0.0006103006,0.002002111,0.002062954,0.0005629704],"domain_scores_gemma":[0.9507777,0.02388991,0.009632101,0.00546246,0.008896271,0.001341564],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.001175284,0.001210776,0.4172883,0.0005488711,0.0006380577,0.0009933665,0.00132636,0.160176,0.007477721,0.001192605,0.04718669,0.360786],"study_design_scores_gemma":[0.0000906998,0.0004653645,0.04911651,0.0001482347,0.0001966463,0.0006745076,0.0003624691,0.9330608,0.007736907,0.001866734,0.006165337,0.0001158039],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8630796,0.003761525,0.08860487,0.004098343,0.0003256051,0.0001393348,0.002709751,0.03347877,0.003802156],"genre_scores_gemma":[0.9387344,0.0005096562,0.0525467,0.0004163477,0.0001343644,0.00005339801,0.004512932,0.0006413102,0.002450847],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01886512,"threshold_uncertainty_score":0.06640005,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.00884423578975883,"score_gpt":0.2223332910563577,"score_spread":0.2134890552665988,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}