MétaCan
Menu
Back to cohort
Record W7043405718

Stabilité du gradient dans les réseaux de neurones récurrents, à décharges et conventionnels

2024· dissertation· fr· W7043405718 on OpenAlexfundno aff

Bibliographic record

VenueKnowledge UdeS (Institutional Deposit of the University of Sherbrooke) · 2024
Typedissertation
Languagefr
FieldEngineering
TopicAdvanced Memory and Neural Computing
Canadian institutionsnot available
FundersCHIST-ERAFonds de recherche du Québec – Nature et technologiesNatural Sciences and Engineering Research Council of Canada
KeywordsDomain (mathematical analysis)StabiliserAgrégation
DOInot available

Abstract

fetched live from OpenAlex

Les percées en intelligence artificielle repoussent les limites de ce qui est possible dans des domaines tels que la santé, la finance et les voitures autonomes, révolutionnant ainsi notre façon de vivre et de travailler. Aucune de ces avancées ne serait concevable sans une compréhension théorique méticuleuse des subtilités de l'apprentissage, de ce qu'il implique et de comment il se déroule. Dans le domaine de l'IA, l'apprentissage est facilité par des gradients, guidant les réseaux neuronaux vers des solutions probables pour les tâches à accomplir. Cependant, un défi bien connu émerge: à mesure que les réseaux neuronaux augmentent en taille, les gradients ont tendance à exploser de manière exponentielle, ce qui rend l'apprentissage plus difficile. Le sujet de cette thèse est le raffinement de techniques bien connues pour éviter l'explosion de gradients dans les architectures neuronales récurrentes, améliorant ainsi leur capacité de généralisation. Malgré une longue lignée de recherche, des techniques de stabilité bien connues n'ont jamais été appliquées pour stabiliser des architectures biologiquement plausibles. En fait, elles nécessitent des gradients approximatifs appelés gradients de substitution (SG) à entraîner par descente de gradient, et il n'existe aucun critère clair pour le choix du SG. Nous démontrons que le choix d'une forme de SG qui stabilise l'amplitude du gradient au fil du temps entraîne une meilleure généralisation, servant de critère précieux pour la sélection du SG. Dans le but de généraliser ce résultat, nous avons observé une incompréhension dans la littérature concernant l'interaction entre la profondeur et le temps dans les réseaux récurrents profonds (d-RNN). En réalité, l'application d'initialisations classiques à propagation avant aux réseaux récurrents produit un gradient qui croît comme un coefficient binomial. Bien que cela réussisse à neutraliser les sources multiplicatives d'explosion exponentielle du gradient, cela néglige une source additive. Nous prouvons mathématiquement et expérimentalement que pondérer par un demi les composantes temporelles et de profondeur du gradient, au lieu de par un, corrige une telle explosion. Enfin, nous proposons une méthode pour pré-entraîner une large famille de d-RNN pour la stabilité basée sur cette analyse théorique. Notre méthode de pré-entraînement dispense les praticiens de développer une analyse mathématique spécifique à l'architecture. Cette thèse étend non seulement l'application des techniques de stabilité à des domaines non conventionnels, mais résout également, d'une certaine manière, une question vieille de trois décennies concernant la caractérisation de l'explosion de gradient dans les d-RNN.

Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.

How this classification was reachedexpand

Full frame machine prediction

Teacher imitation

Not calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.

metaresearch head score (Codex)0.000
metaresearch head score (Gemma)0.002
Version: metacan-v3-hybrid-931329e0061cValidation status: machine_predicted_unvalidated
Candidate categoriesnone
Consensus categoriesnone
DomainCandidate signal: none · Consensus signal: none
Study designCandidate signal: Simulation or modeling · Consensus signal: none
GenreCandidate signal: Empirical · Consensus signal: none
Teacher disagreement score0.004
Threshold uncertainty score0.015

Distilled classifier scores by category (both heads)

CategoryCodexGemma
Metaresearch0.0000.002
Meta-epidemiology (narrow)0.0010.000
Meta-epidemiology (broad)0.0000.001
Bibliometrics0.0000.000
Science and technology studies0.0000.001
Scholarly communication0.0010.002
Open science0.0010.001
Research integrity0.0010.002
Insufficient payload (model declined to judge)0.0040.001

Machine scores (provisional)

The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.

Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.

Opus teacher head0.015
GPT teacher head0.224
Teacher spread0.209 · how far apart the two teachers sit on this one work
Validation statusscore_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from it

Classification

machine, unvalidated

Machine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.

The models applied no category: nothing in the taxonomy fit this work.
Study designSimulation or modeling
Domainnot available
GenreEmpirical

How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".

Quick stats

Citations0
Published2024
Admission routes1
Has abstractyes

Explore more

Same venueKnowledge UdeS (Institutional Deposit of the University of Sherbrooke)Same topicAdvanced Memory and Neural ComputingFrench-language works237,207