{"id":"W7034215471","doi":"","title":"Towards accurate low-bitwidth BERT","year":2023,"lang":"en","type":"dissertation","venue":"eScholarship@McGill (McGill)","topic":"Education, Innovation and Language Studies","field":"Social Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"","keywords":"Quantization (signal processing); Encoder; Pruning; Computational complexity theory; Edge device; Focus (optics); Language model","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0009136935,0.00135891,0.0008477794,0.0007001227,0.0003774718,0.001567204,0.001919734,0.001137296,0.004288841],"category_scores_gemma":[0.006287798,0.0007296845,0.0006325949,0.0008162608,0.0006321426,0.004661252,0.001732196,0.003042723,0.002182998],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001111967,"about_ca_system_score_gemma":0.001504148,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007567874,"about_ca_topic_score_gemma":0.01319578,"domain_scores_codex":[0.9993966,0.0001485494,0.0000361651,0.0001505308,0.0001928576,0.00007528875],"domain_scores_gemma":[0.9987887,0.0005388026,0.00009581586,0.0003125875,0.0002152301,0.00004885346],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0006385035,0.0001975635,0.002353419,0.0002546288,0.00007857656,0.0001804225,0.0002236234,0.4796002,0.0189175,0.02765497,0.01549322,0.4544073],"study_design_scores_gemma":[0.00001547878,0.00003459945,0.0001098184,0.00001586612,0.000008587077,0.00002797143,0.0000261214,0.9851676,0.004112072,0.008979834,0.001493341,0.000008806286],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.06336873,0.001189179,0.9140229,0.0007257967,0.0001966406,0.000105634,0.001358419,0.01373283,0.005299901],"genre_scores_gemma":[0.6690204,0.0008004135,0.3160295,0.0007681823,0.0000695484,0.0002444555,0.00398127,0.001081193,0.008005086],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.007567874,"threshold_uncertainty_score":0.01504767,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03855977822781113,"score_gpt":0.3408740432404509,"score_spread":0.3023142650126397,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}