MétaCan
Menu
Retour à la cohorte
Enregistrement W7034215471

Towards accurate low-bitwidth BERT

2023· dissertation· en· W7034215471 sur OpenAlexaff

Notice bibliographique

RevueeScholarship@McGill (McGill) · 2023
Typedissertation
Langueen
DomaineSocial Sciences
ThématiqueEducation, Innovation and Language Studies
Établissements canadiensMcGill University
Organismes subventionnairesnon disponible
Mots-clésQuantization (signal processing)EncoderPruningComputational complexity theoryEdge deviceFocus (optics)Language model
DOInon disponible

Résumé

récupéré en direct d'OpenAlex

Transformer-based models or BERT (Bidirectional Encoder Representations from Transformers) models have seen a lot of success in natural language processing tasks in recent years.However, these networks are very difficult to deploy on edge devices where memory and compute resources are limited.To lower their computational and memory cost, pruning and quantization can be applied.However, naively applying these techniques to compress transformers, can cause a significant reduction in the accuracy of these models.This thesis will focus on improving the performance of quantization-aware training or improving the final performance or accuracy of a quantized transformer-based model without increasing the computational complexity of the forward pass of the network or slightly changing the network's architecture to increase the model capacity.In this thesis, we give one example of such and propose a more efficient quantization-aware training pipeline, called Efficient Two Stage Progressive Quantization in which the model with quantized weights is fine-tuned first, and at the same time, the bitwidth of the weights is lowered.Then, the model with quantized weights and activations will be fine-tuned.At Abstract ii the same time, we strategically choose which bitwidth to fine-tune on and to initialize from, and which bitwidth to fine-tune under augmented data.We are able to ternarize the weights of BERT, compressing it by 14.9x while outperforming the full-precision model performance across nearly all GLUE datasets, and without data augmentation, it can outperform existing BERT ternarization methods.Also, we outperform the state-of-the-art BERT binarization in performance without adding an extra module, saving 18% more memory than BinaryBERT.iii Abrg Les modles bass sur les transformateurs ou modles BERT (Bidirectional Encoder Representations from Transformers) ont connu beaucoup de succs dans les tches de traitement du langage naturel ces dernires annes.Cependant, ces rseaux sont trs difficiles dployer sur des priphriques priphriques o les ressources de mmoire et de calcul sont limites.Pour rduire leur cot de calcul et de mmoire, l'lagage et la quantification peuvent tre appliqus.Cependant, l'application nave de ces techniques pour compresser les transformateurs peut entraner une rduction significative de la prcision de ces modles.Cette thse se concentrera sur l'amlioration des performances de la formation sensible la quantification ou sur l'amlioration des performances finales ou de la prcision d'un modle bas sur un transformateur quantifi sans augmenter la complexit de calcul de la passe avant du rseau ou en modifiant lgrement l'architecture du rseau pour augmenter la capacit du modle.Dans cette thse, nous en donnons un exemple et proposons un pipeline de formation sensible la quantification plus efficace, appel Efficient Two Stage Progressive Quantization Abrg iv dans lequel le modle avec des poids quantifis est affin en premier, et en mme temps, la largeur de bit du les poids sont abaisss.Ensuite, le modle avec les poids quantifis et les activations sera affin.En mme temps, nous choisissons stratgiquement la largeur de bit affiner et partir de laquelle initialiser, et la largeur de bit affiner sous les donnes augmentes.Nous sommes en mesure de ternariser les poids de BERT, en le compressant de 14,9x tout en surpassant les performances du modle de prcision totale sur presque tous les ensembles de donnes GLUE, et sans augmentation des donnes, il peut surpasser les mthodes de ternarisation BERT existantes.De plus, nous surpassons la binarisation BERT de pointe en termes de performances sans ajouter de module supplmentaire, ce qui permet d'conomiser 18% de mmoire en plus que BinaryBERT.v List of Tables xi 3.10 Performance of using Direction Mismatch Distillation (DMD) versus using Mean Square Error (MSE) Distillation. . . . . . . . . . . . . . . . . . . . .

Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.

Comment cette classification a été obtenuedéplier

Prédiction distillée sur la base complète

Imitation des enseignants

Ni prévalence calibrée, ni vérité terrain. Validation humaine à venir. Apprise à partir de 10 348 étiquettes directes de Codex et de 10 348 étiquettes directes de Gemma. Le mode candidate est l'union des têtes enseignantes seuillées; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont ni des étiquettes humaines ni des étiquettes directes de modèles de pointe.

score de la tête « metaresearch » (Codex)0,002
score de la tête « metaresearch » (Gemma)0,004
Version: codex-gemma-dda1882f352aStatut de validation: machine_predicted_unvalidated
Catégories candidatesMéta-épidémiologie (sens strict), Études des sciences et des technologies, Charge utile insuffisante (le modèle a refusé de juger)
Catégories consensuellesCharge utile insuffisante (le modèle a refusé de juger)
DomaineSignal candidat: aucune · Signal consensuel: aucune
Devis d'étudeSignal candidat: Sans objet · Signal consensuel: aucune
GenreSignal candidat: Empirique · Signal consensuel: Empirique
Score de désaccord entre enseignants0,864
Score d'incertitude au seuil1,000

Scores Codex et Gemma par catégorie

CatégorieCodexGemma
Métarecherche0,0020,004
Méta-épidémiologie (sens strict)0,0010,001
Méta-épidémiologie (sens large)0,0010,000
Bibliométrie0,0010,002
Études des sciences et des technologies0,0040,000
Communication savante0,0000,001
Science ouverte0,0010,000
Intégrité de la recherche0,0010,001
Charge utile insuffisante (le modèle a refusé de juger)0,0050,001

Scores machine (provisoires)

Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.

Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.

Tête enseignante Opus0,039
Tête enseignante GPT0,341
Écart entre enseignants0,302 · la distance entre les deux têtes enseignantes sur ce seul travail
Statut de validationscore_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découle

Classification

machine, non validée

Prédiction automatique; les deux têtes enseignantes s’accordent sur ce qui est montré ici.

Devis d'étudeSans objet
Domainenon disponible
GenreEmpirique

Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».

En bref

Citations0
Publié2023
Routes d'admission1
Résumé présentoui

Explorer davantage

Même revueeScholarship@McGill (McGill)Même sujetEducation, Innovation and Language StudiesTravaux en français237 207