{"id":"W3160700180","doi":"10.1109/icse43902.2021.00138","title":"Automatic Unit Test Generation for Machine Learning Libraries: How Far Are We?","year":2021,"lang":"en","type":"article","venue":"","topic":"Software Testing and Debugging Techniques","field":"Computer Science","cited_by":37,"is_retracted":false,"has_abstract":true,"ca_institutions":"York University","funders":"Natural Sciences and Engineering Research Council of Canada; National Natural Science Foundation of China","keywords":"Unit testing; Test suite; Machine learning; Computer science; Artificial intelligence; Test (biology); Test Management Approach; Code coverage; Unit (ring theory); Test set; Set (abstract data type); Software; Quality (philosophy); Test case; Software development; Programming language; Software construction","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01551413,0.001770793,0.001335176,0.002758745,0.0009805649,0.004781687,0.004139474,0.002694658,0.00375675],"category_scores_gemma":[0.07698116,0.0005621425,0.001083576,0.002808138,0.002082185,0.01546559,0.002467645,0.003387258,0.002393029],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001432279,"about_ca_system_score_gemma":0.003922177,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00435308,"about_ca_topic_score_gemma":0.005393631,"domain_scores_codex":[0.9865042,0.006168488,0.000796431,0.001520426,0.004037767,0.0009727656],"domain_scores_gemma":[0.9173309,0.05014495,0.005979875,0.009682321,0.01401688,0.002845081],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0004855811,0.0005593731,0.02849326,0.001105194,0.0001383407,0.0001900281,0.0008530344,0.008532635,0.006994031,0.007323382,0.0108696,0.9344557],"study_design_scores_gemma":[0.001099058,0.008654247,0.1032255,0.013997,0.001689237,0.004843318,0.01711023,0.4037195,0.0860844,0.1246239,0.234102,0.000851756],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.435554,0.09744675,0.356097,0.07222625,0.0008182723,0.0006103446,0.001082306,0.01870642,0.01745873],"genre_scores_gemma":[0.6990278,0.01431351,0.2736368,0.005359166,0.000437698,0.0003231886,0.002054322,0.001986783,0.002860706],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01551413,"threshold_uncertainty_score":0.08204758,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06743097283882477,"score_gpt":0.2686211446901192,"score_spread":0.2011901718512945,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}