{"id":"W2805097135","doi":"10.1109/icst.2018.00038","title":"Investigating NLP-Based Approaches for Predicting Manual Test Case Failure","year":2018,"lang":"en","type":"article","venue":"","topic":"Software Engineering Research","field":"Computer Science","cited_by":25,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Calgary","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Test script; Regression testing; Test suite; Test (biology); Test case; Feature selection; Manual testing; Artificial intelligence; Heuristics; Test Management Approach; Feature (linguistics); Software regression; Machine learning; Software; Data mining; Programming language; Software system; Software quality; Software development; Regression analysis; Software construction","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0005809477,0.0001243913,0.0001005129,0.0001126534,0.0002360928,0.0002073052,0.0005495155,0.00006369621,0.000009653953],"category_scores_gemma":[0.003567575,0.0001123553,0.00004013663,0.0003808076,0.0001008566,0.0002787556,0.0001964922,0.000139281,0.00002312876],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00004196686,"about_ca_system_score_gemma":0.0001123246,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00004006022,"about_ca_topic_score_gemma":0.00004323682,"domain_scores_codex":[0.9987707,0.00002146739,0.0001648713,0.0003916057,0.0002445395,0.0004068067],"domain_scores_gemma":[0.9969298,0.002286481,0.00003603019,0.0004590637,0.0001279438,0.0001607337],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00001375629,0.000596771,0.6710281,0.001364085,0.000161118,0.0008672908,0.01016175,0.01152049,0.006886978,0.0466321,0.04551429,0.2052532],"study_design_scores_gemma":[0.000295886,0.0002257571,0.001205204,0.00002669164,0.000002743946,0.0001926237,0.0001020033,0.9854982,0.01146751,0.0002826519,0.0005333676,0.0001672947],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1478015,0.000007644641,0.8501257,0.0007163703,0.00011207,0.0002796255,0.000004423642,0.0007254755,0.0002271699],"genre_scores_gemma":[0.6013173,1.697408e-8,0.3982379,0.00007754355,0.0001947365,0.0000522495,0.000001600886,0.00001141853,0.0001072304],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.9739777,"threshold_uncertainty_score":0.4581714,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05785945074806147,"score_gpt":0.2848859189331134,"score_spread":0.2270264681850519,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}