{"id":"W3118325553","doi":"10.48550/arxiv.2301.12006","title":"Improved knowledge distillation by utilizing backward pass knowledge in neural networks","year":2023,"lang":"en","type":"article","venue":"arXiv (Cornell University)","topic":"Advanced Neural Network Applications","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University; University of Waterloo","funders":"","keywords":"Distillation; Divergence (linguistics); Artificial neural network; Computer science; Matching (statistics); Set (abstract data type); Domain knowledge; Artificial intelligence; Training set; Machine learning; Natural language processing; Mathematics; Statistics; Chromatography","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001606509,0.001531034,0.001375831,0.001135539,0.0006102098,0.00116127,0.002099977,0.001728624,0.001651787],"category_scores_gemma":[0.005807698,0.0007126385,0.0008673412,0.001231803,0.00125468,0.00345143,0.002277285,0.002473915,0.0006874193],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001015576,"about_ca_system_score_gemma":0.001539946,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008216491,"about_ca_topic_score_gemma":0.009663546,"domain_scores_codex":[0.9992583,0.0001896364,0.0000512224,0.0001927252,0.0002138005,0.00009418627],"domain_scores_gemma":[0.997974,0.001061678,0.0001469255,0.0004220751,0.0003265247,0.00006877674],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.0002457844,0.0002357528,0.001207347,0.0001032851,0.0001065554,0.000135203,0.0001747314,0.6838877,0.009887238,0.00925385,0.00211246,0.29265],"study_design_scores_gemma":[0.00000955224,0.00002900814,0.00007216363,0.000004682725,0.000008633887,0.00001372921,0.000005881312,0.9934442,0.002321204,0.00377412,0.0003106878,0.000006182926],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.06402751,0.0004862399,0.9296085,0.0003397585,0.00006612909,0.00007965843,0.0001605009,0.002921343,0.002310347],"genre_scores_gemma":[0.6588303,0.0002371876,0.3353329,0.0004011657,0.00007458017,0.0001830412,0.001000008,0.000303452,0.003637357],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.008216491,"threshold_uncertainty_score":0.01633734,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05746430418862464,"score_gpt":0.2194172936300952,"score_spread":0.1619529894414705,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}