{"id":"W4390091644","doi":"10.48550/arxiv.2312.12604","title":"An empirical study of testing machine learning in the wild","year":2023,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Software Testing and Debugging Techniques","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Oracle; Software reliability testing; White-box testing; Regression testing; Software construction; Software engineering; Test strategy; System integration testing; Software system; Workflow; Software quality assurance; Software quality; Empirical research; Artificial intelligence; Machine learning; Software; Software development; Database; Programming language","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.03810697,0.0006715626,0.0006916664,0.003610758,0.001211424,0.002466443,0.003027668,0.002097363,0.001680932],"category_scores_gemma":[0.2675855,0.000625324,0.0006769971,0.003439614,0.005519794,0.005898272,0.002063095,0.003060749,0.0006717239],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001780372,"about_ca_system_score_gemma":0.001149077,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002869316,"about_ca_topic_score_gemma":0.003288803,"domain_scores_codex":[0.9303933,0.04313614,0.0052296,0.007056679,0.01252663,0.001657576],"domain_scores_gemma":[0.3790443,0.5273221,0.03442742,0.03297315,0.0219527,0.004280379],"domain_codex":null,"domain_gemma":"reproducibility","domain_candidate":"reproducibility","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0008689834,0.002358625,0.8366539,0.0007588955,0.0003479196,0.001376205,0.0151497,0.00863536,0.002884276,0.006906654,0.01013389,0.1139256],"study_design_scores_gemma":[0.0004172772,0.004146738,0.7101648,0.001264163,0.0002846099,0.004917662,0.02680326,0.1815487,0.012618,0.0226061,0.03487625,0.0003523567],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9882317,0.0003799683,0.007967422,0.000756739,0.00003173815,0.0001416491,0.0006570531,0.0001852676,0.001648469],"genre_scores_gemma":[0.9907135,0.0001070812,0.00708844,0.0002597777,0.00003160012,0.0001816979,0.001167879,0.0001009055,0.0003490765],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.961893,"threshold_uncertainty_score":0.2015313,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2109586510133546,"score_gpt":0.2677698645024746,"score_spread":0.05681121348912002,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}