{"id":"W7132866158","doi":"","title":"MPBRQ - A Framework for Mixed-Precision Quantization for Large Language Models","year":2024,"lang":"","type":"dissertation","venue":"TSpace","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"University of Toronto","keywords":"Speedup; Quantization (signal processing); Kernel (algebra); Language model; Acceleration; Vector quantization","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003356411,0.001559655,0.001393326,0.001203957,0.000840609,0.003291246,0.004822819,0.00210517,0.01249481],"category_scores_gemma":[0.01406463,0.001370332,0.00222196,0.001328647,0.001453505,0.005367248,0.0037288,0.004558353,0.005858908],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002145839,"about_ca_system_score_gemma":0.003022581,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01441028,"about_ca_topic_score_gemma":0.02646711,"domain_scores_codex":[0.9975255,0.0006541254,0.0001921988,0.0005499318,0.0009312365,0.0001469938],"domain_scores_gemma":[0.9972011,0.001363349,0.0001544022,0.0006648973,0.000522963,0.00009327666],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0005781594,0.0001863079,0.001215619,0.0007564659,0.0003264586,0.000299525,0.0005940667,0.2943867,0.0196685,0.1400433,0.05154621,0.4903986],"study_design_scores_gemma":[0.00004844683,0.00003502544,0.00007393292,0.0000323709,0.00001675424,0.00004996544,0.0000268344,0.9292638,0.003632772,0.0595704,0.007219503,0.00003030176],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.001169377,0.0003036027,0.980476,0.0001967586,0.00006337144,0.00006136281,0.0004414089,0.01650234,0.0007857649],"genre_scores_gemma":[0.07269886,0.0004105424,0.917072,0.0004389666,0.0001081226,0.0003692771,0.002011585,0.003864422,0.003026236],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01441028,"threshold_uncertainty_score":0.04179931,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02588322595207796,"score_gpt":0.3958974775084187,"score_spread":0.3700142515563407,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}