{"id":"W4404838900","doi":"10.1142/s0218539324500578","title":"Machine Learning-Based Reliability Evaluation for Software Defect Prediction and Model Validation Assessment","year":2024,"lang":"en","type":"article","venue":"International Journal of Reliability Quality and Safety Engineering","topic":"Software Reliability and Analysis Research","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Reliability engineering; Reliability (semiconductor); Computer science; Software quality; Verification and validation; Model validation; Software; Machine learning; Predictive modelling; Artificial intelligence; Engineering; Software development; Programming language","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006205983,0.001073084,0.0008268252,0.002651485,0.0003811723,0.0009848286,0.001102955,0.0009946509,0.001157618],"category_scores_gemma":[0.01779689,0.0002781773,0.000653166,0.001080142,0.0006054839,0.001237643,0.001062361,0.0009927503,0.0003227148],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001047436,"about_ca_system_score_gemma":0.001065257,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003206533,"about_ca_topic_score_gemma":0.002646727,"domain_scores_codex":[0.9969002,0.001416703,0.0002250321,0.0002843929,0.001024333,0.0001494158],"domain_scores_gemma":[0.9890528,0.0063641,0.001113187,0.001154734,0.002155781,0.0001594007],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001326016,0.0001608087,0.007983701,0.0001231303,0.0001045446,0.0000529703,0.00004837174,0.905344,0.002948953,0.003967511,0.0005918082,0.07854167],"study_design_scores_gemma":[0.000001817702,0.00004497838,0.0005485608,0.000006759002,0.000005306512,0.00001052108,0.000005045982,0.9977597,0.000849163,0.0006634463,0.0001008486,0.000003971712],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.09377554,0.0004148506,0.9018915,0.0001589149,0.00003581196,0.0001166493,0.0001571015,0.001056562,0.002393127],"genre_scores_gemma":[0.9176096,0.0001441948,0.08099303,0.00004312544,0.00002565832,0.0001454353,0.000292215,0.0000566603,0.0006900462],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006205983,"threshold_uncertainty_score":0.03282082,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03188100837465722,"score_gpt":0.3559982628762541,"score_spread":0.3241172545015968,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}