{"id":"W6976597069","doi":"10.60692/ck6mt-jht14","title":"f-Divergence Minimization for Sequence-Level Knowledge Distillation","year":2023,"lang":"en","type":"article","venue":"Greater South Information System","topic":"Topic Modeling","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Canadian Institute for Advanced Research; McGill University; University of Alberta","funders":"","keywords":"Distillation; Divergence (linguistics); Minification; Process (computing); Decomposition; Natural language","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0003579877,0.0001212085,0.0001281946,0.0002828682,0.0001951782,0.0002266429,0.00038632,0.00007548356,0.000002758225],"category_scores_gemma":[0.0000473933,0.0001110631,0.00005550552,0.0005894567,0.0000109089,0.001426556,0.0001184264,0.00003619318,0.0009054943],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001090533,"about_ca_system_score_gemma":0.00005722893,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000002614379,"about_ca_topic_score_gemma":1.654747e-7,"domain_scores_codex":[0.9988557,0.00003277321,0.0004693163,0.0001934479,0.0002177948,0.0002309974],"domain_scores_gemma":[0.9990378,0.00001779419,0.0002018299,0.0003979873,0.0002815069,0.0000630714],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000058356,0.000006884797,0.127441,0.002769018,0.0001024992,0.00000532759,0.5167148,0.08951695,0.00003061685,0.1858373,0.004531648,0.07298564],"study_design_scores_gemma":[0.0003222038,0.00001417432,0.01211761,0.00005970225,0.000004727434,0.000005861569,0.00117692,0.9851832,0.000162736,0.00003672235,0.0007666044,0.0001495707],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.04169396,0.000001160578,0.9547013,0.0000787453,0.001008624,0.0004134001,0.00007026977,0.0007451012,0.00128741],"genre_scores_gemma":[0.9845237,1.323081e-7,0.01482433,0.00003180215,0.00008700588,0.0001088561,0.00004748816,0.000005584593,0.0003711459],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9428297,"threshold_uncertainty_score":0.9998724,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1529844675221668,"score_gpt":0.2700700095088802,"score_spread":0.1170855419867133,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}