Large Scale Conditional Multitask Learning for Natural Language Processing
Bibliographic record
Abstract
Récemment, les "Masked Language Models" (MLMs) entrainés sur une large base de données non étiquetées ont généré des résultats de pointe pour plusieurs tâches dans le domaine du Traitement de Langage Naturel (NLP).Un grand nombre des soumissions les mieux classées au benchmark "General Language Understanding Evaluation" (GLUE) utilisent un modèle basé sur l'architecture "Bidirectional Encoder Representations from Transformers" (BERT).La formule "BERT + "fine tuning" par tâche individuelle" demeure prévalente dans la recherche ; cet outil permet en effet à plusieurs chercheurs d'aboutir à des résultats de pointe.Cependant, la méthode du "fine-tuning" manque d'efficacité quant à la quantité de paramètres utilisés, puisqu'il est probable qu'elle requière un nouveau modèle pour chaque tâche.De plus, cette méthode est susceptible d'entraîner la perte des connaissances acquises durant l'étape riche en données du pré-entraînement, ce qui pourrait affecter la performance de généralisation du modèle.L'Apprentissage Multi-Tâche (MTL) est une approche efficace par transfert inductif inspirée par les modes d'apprentissage de l'humain qui s'avère prometteuse dans le domaine du Traitement de Langage Naturel.Pourtant, le MTL n'atteint pas le même niveau de performance que l'approche du "fine-tuning" qui est encore appliquée après l'étape de l'Apprentissage Multi-Tâche dans plusieurs études.Ce manque de performance est dû aux difficultés additionnelles telles que le transfert négatif, le sur-apprentissage de tâches pauvres en données et la perte de connaissances.Cette thèse a pour objectif d'explorer la possibilité de surpasser la performance de la méthode de "fine-tuning" en utilisant exclusivement l'Apprentissage Multi-Tâche.Cette recherche prendra en compte les défis d'optimisation connus de l'Apprentissage Multi-Tâche et des problèmes communs relatifs aux données.De plus, elle doit limiter du mieux possible la perte de connaissances acquises à l'étape du pré-entrainement, doit s'adapter facilement aux nouvelles tâches et être compatible avec tous les types de "Transformer".Nous partons sur l'hypothèse qu'une architecture conditionnée par tâche est capable de gérer une configuration de MTL à grande échelle afin de maximiser le transfert entre toutes les tâches.L'utilisation d'une méthode d'échantillonnage basée sur la difficulté de chaque tâche pourrait gérer les différents niveaux de difficulté des tâches, ainsi que minimiser l'interférence et la perte de connaissances.Nous proposons un modèle innovateur basé sur l'architecture "Transformer" que nous nommons "Conditional Adaptive Multitask Learning" (CA-MTL).Cette approche consiste en un nouveau mécanisme d'attention conditionnelle et un ensemble de modules conditionnés par vi tâche facilitant le partage de paramètres.Par le biais de ce modèle nous atteignons un partage de paramètres plus efficace et limitons la perte de connaissances en fixant les paramètres du modèle pré-entraîné.En utilisant CA-MTL, nous obtenons une meilleure performance que la méthode du "fine tuning" par tâche individuelle, tout en optimisant les données et les paramètres.Notre petit modèle a de ce fait obtenu une performance 2.2% supérieure à celle d'un grand modèle BERT pour le benchmark GLUE ; ces résultats ont été atteints en utilisant uniquement 64.6% des données et en ajoutant 5.6% de paramètres entraînables additionnels par tâche.Il est à noter ici qu'une méthode de "fine tuning" naïve peut ajouter jusqu'à 100% de paramètres entraînables.Notre approche s'est par ailleurs démontrée concurrentielle pour 26 tâches de Traitement de Langage Naturel, parvenant à des résultats novateurs sur plusieurs ensembles de test et de développement.vii
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame machine prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.
Distilled classifier scores by category (both heads)
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.003 | 0.006 |
| Meta-epidemiology (narrow) | 0.001 | 0.000 |
| Meta-epidemiology (broad) | 0.001 | 0.001 |
| Bibliometrics | 0.001 | 0.001 |
| Science and technology studies | 0.001 | 0.001 |
| Scholarly communication | 0.001 | 0.002 |
| Open science | 0.002 | 0.002 |
| Research integrity | 0.001 | 0.002 |
| Insufficient payload (model declined to judge) | 0.005 | 0.002 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".