{"id":"W3196351123","doi":"","title":"Leveraging Documentation to Test Deep Learning Library Functions","year":2021,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Software Testing and Debugging Techniques","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Fuzz testing; Constraint (computer-aided design); Code (set theory); Artificial intelligence; Software bug; Machine learning; Data mining; Software; Programming language; Set (abstract data type)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007977188,0.001699391,0.0006466515,0.002973624,0.0007161096,0.002559815,0.00311554,0.001518874,0.002941196],"category_scores_gemma":[0.07904299,0.001258533,0.0009961488,0.001551735,0.001612766,0.006340321,0.002495039,0.00242238,0.001673213],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002264212,"about_ca_system_score_gemma":0.003818718,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007451934,"about_ca_topic_score_gemma":0.009539437,"domain_scores_codex":[0.9862147,0.00275554,0.001581141,0.002199721,0.006589368,0.0006596157],"domain_scores_gemma":[0.9151898,0.04443846,0.007830482,0.01777127,0.01364908,0.001120912],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.00137683,0.001092852,0.1255665,0.002024079,0.00036744,0.001871545,0.001502499,0.06755872,0.05082976,0.01775848,0.04440049,0.6856509],"study_design_scores_gemma":[0.0002885362,0.0007722925,0.02029631,0.0006795541,0.0002020872,0.0009910476,0.0003817576,0.6530114,0.2577093,0.02344858,0.04198539,0.0002338067],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.5352746,0.001891459,0.2937252,0.002328384,0.0002937668,0.0005695552,0.005707027,0.1481342,0.01207585],"genre_scores_gemma":[0.7930176,0.0004686656,0.1875288,0.001062922,0.00004738658,0.0002911888,0.007083139,0.007491506,0.003008907],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.007977188,"threshold_uncertainty_score":0.04218793,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05306870260441219,"score_gpt":0.1940805870896694,"score_spread":0.1410118844852572,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}