MétaCan
Menu
← Back to cohort
Record W7029881761

Large Scale Conditional Multitask Learning for Natural Language Processing

2021· other· fr· W7029881761 on OpenAlexfundno aff

Bibliographic record

VenuePolyPublie (École Polytechnique de Montréal) · 2021
Typeother
Languagefr
Field
Topic
Canadian institutionsnot available
FundersPolytechnique MontréalNatural Sciences and Engineering Research Council of CanadaCanadian Institute for Advanced Research
KeywordsFilter (signal processing)LimitingNucleofectionFeature (linguistics)
DOInot available

Abstract

fetched live from OpenAlex

Récemment, les "Masked Language Models" (MLMs) entrainés sur une large base de données non étiquetées ont généré des résultats de pointe pour plusieurs tâches dans le domaine du Traitement de Langage Naturel (NLP).Un grand nombre des soumissions les mieux classées au benchmark "General Language Understanding Evaluation" (GLUE) utilisent un modèle basé sur l'architecture "Bidirectional Encoder Representations from Transformers" (BERT).La formule "BERT + "fine tuning" par tâche individuelle" demeure prévalente dans la recherche ; cet outil permet en effet à plusieurs chercheurs d'aboutir à des résultats de pointe.Cependant, la méthode du "fine-tuning" manque d'efficacité quant à la quantité de paramètres utilisés, puisqu'il est probable qu'elle requière un nouveau modèle pour chaque tâche.De plus, cette méthode est susceptible d'entraîner la perte des connaissances acquises durant l'étape riche en données du pré-entraînement, ce qui pourrait affecter la performance de généralisation du modèle.L'Apprentissage Multi-Tâche (MTL) est une approche efficace par transfert inductif inspirée par les modes d'apprentissage de l'humain qui s'avère prometteuse dans le domaine du Traitement de Langage Naturel.Pourtant, le MTL n'atteint pas le même niveau de performance que l'approche du "fine-tuning" qui est encore appliquée après l'étape de l'Apprentissage Multi-Tâche dans plusieurs études.Ce manque de performance est dû aux difficultés additionnelles telles que le transfert négatif, le sur-apprentissage de tâches pauvres en données et la perte de connaissances.Cette thèse a pour objectif d'explorer la possibilité de surpasser la performance de la méthode de "fine-tuning" en utilisant exclusivement l'Apprentissage Multi-Tâche.Cette recherche prendra en compte les défis d'optimisation connus de l'Apprentissage Multi-Tâche et des problèmes communs relatifs aux données.De plus, elle doit limiter du mieux possible la perte de connaissances acquises à l'étape du pré-entrainement, doit s'adapter facilement aux nouvelles tâches et être compatible avec tous les types de "Transformer".Nous partons sur l'hypothèse qu'une architecture conditionnée par tâche est capable de gérer une configuration de MTL à grande échelle afin de maximiser le transfert entre toutes les tâches.L'utilisation d'une méthode d'échantillonnage basée sur la difficulté de chaque tâche pourrait gérer les différents niveaux de difficulté des tâches, ainsi que minimiser l'interférence et la perte de connaissances.Nous proposons un modèle innovateur basé sur l'architecture "Transformer" que nous nommons "Conditional Adaptive Multitask Learning" (CA-MTL).Cette approche consiste en un nouveau mécanisme d'attention conditionnelle et un ensemble de modules conditionnés par vi tâche facilitant le partage de paramètres.Par le biais de ce modèle nous atteignons un partage de paramètres plus efficace et limitons la perte de connaissances en fixant les paramètres du modèle pré-entraîné.En utilisant CA-MTL, nous obtenons une meilleure performance que la méthode du "fine tuning" par tâche individuelle, tout en optimisant les données et les paramètres.Notre petit modèle a de ce fait obtenu une performance 2.2% supérieure à celle d'un grand modèle BERT pour le benchmark GLUE ; ces résultats ont été atteints en utilisant uniquement 64.6% des données et en ajoutant 5.6% de paramètres entraînables additionnels par tâche.Il est à noter ici qu'une méthode de "fine tuning" naïve peut ajouter jusqu'à 100% de paramètres entraînables.Notre approche s'est par ailleurs démontrée concurrentielle pour 26 tâches de Traitement de Langage Naturel, parvenant à des résultats novateurs sur plusieurs ensembles de test et de développement.vii

Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.

How this classification was reachedexpand

Full frame machine prediction

Teacher imitation

Not calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.

metaresearch head score (Codex)0.003
metaresearch head score (Gemma)0.006
Version: metacan-v3-hybrid-931329e0061cValidation status: machine_predicted_unvalidated
Candidate categoriesnone
Consensus categoriesnone
DomainCandidate signal: none · Consensus signal: none
Study designCandidate signal: Simulation or modeling · Consensus signal: none
GenreCandidate signal: Methods · Consensus signal: Methods
Teacher disagreement score0.013
Threshold uncertainty score0.026

Distilled classifier scores by category (both heads)

CategoryCodexGemma
Metaresearch0.0030.006
Meta-epidemiology (narrow)0.0010.000
Meta-epidemiology (broad)0.0010.001
Bibliometrics0.0010.001
Science and technology studies0.0010.001
Scholarly communication0.0010.002
Open science0.0020.002
Research integrity0.0010.002
Insufficient payload (model declined to judge)0.0050.002

Machine scores (provisional)

The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.

Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.

Opus teacher head0.008
GPT teacher head0.256
Teacher spread0.248 · how far apart the two teachers sit on this one work
Validation statusscore_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from it

Classification

machine, unvalidated

Machine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.

The models applied no category: nothing in the taxonomy fit this work.
Study designSimulation or modeling
Domainnot available
GenreMethods

How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".

Quick stats

Citations0
Published2021
Admission routes1
Has abstractyes

Explore more

Same venuePolyPublie (École Polytechnique de Montréal)→French-language works237,207→