MétaCan
Menu
Back to cohort
Record W4393370699

Automatic Speech Recognition : from hybrid to end-to-end approach

2021· preprint· fr· W4393370699 on OpenAlexaboutno aff
Abdelwahab Heba

Bibliographic record

Venuetheses.fr (ABES) · 2021
Typepreprint
Languagefr
FieldComputer Science
TopicSpeech Recognition and Synthesis
Canadian institutionsnot available
Fundersnot available
KeywordsEnd-to-end principleSpeech recognitionComputer scienceArtificial intelligence
DOInot available

Abstract

fetched live from OpenAlex

Ma thèse s'inscrit dans le cadre du projet de recherche OpenPaasNG 1 qui a été lancé en 2015 pour une durée de 4 ans avec l'objectif de développer une nouvelle génération de plateforme collaborative proposant un outil de visio-conférence utilisant des technologies d'intelligence artificielle pour la transcription de la parole, l'extraction des mots clés et le résumé automatique des réunions. Dans ce contexte, l'objectif de cette thèse est d'étudier, d'approfondir, de construire et d'enrichir la brique de reconnaissance automatique de la parole (RAP) pour aider à l'exploitation de l'information verbale durant les réunions en temps réel et en off-line à des fins d'archivage. Cette thèse porte sur l'étude des méthodes de modélisation acoustique pour la RAP. Le boule- versement des architectures neuronales séquentielles ont permis de nos jours des avancées majeures dans l'amélioration de la modélisation et l'apprentissage du modèle acoustique. Nous explorons dans ce travail les deux grandes familles des systèmes RAP à savoir : les approches traditionnelles hybrides et End-to-End. Une première partie de cette thèse concerne les approches traditionnelles et est dédiée à la mise en place d'un système RAP large vocabulaire en français pour la parole spontanée, déployé dans le contexte industriel. Un grand travail de collecte de données, de traitement et de normalisation a été effectué dans un premier temps pour atteindre l'objectif des 1000 heures de parole annotée. Une évaluation des composants acoustique, lexical et linguistique est proposée pour affiner au mieux le choix et l'orientation de la modélisation hybride DNN-HMM pour la langue française. Nous décri- vons dans cette partie le développement de la plateforme industrielle d'adaptation des composants hybrides appelée "LinSTT Model Factory" permettant une adaptation des modèles aux conditions d'utilisations, à savoir : un contexte acoustique particulier, un vocabulaire spécifique à un domaine cible. Dans une deuxième partie, nous abordons la problématique de prédiction de représentation textuelle directement à partir des observations acoustiques. Pour cela, nous effectuons une étude approfondie des approches RAP End-to-End : comment pouvons nous apprendre des alignements séquentiels entre l'audio et le texte ? Quel type d'architecture utiliser ? Et surtout, quel type d'unités en sortie choisir (caractère, pièce de mot, mot) ? Nous répondons à ces questions avec un ensemble d'expérience sur les corpus TIMIT et LibriSpeech. Ces travaux ont été, dans une grande partie, menés au cours d'un séjour scientifique au laboratoire du Mila au Canada dans le cadre du développement de l'outil open-source "SpeechBrain". Dans une troisième partie, nous explorons des approches multi-tâche sur les systèmes RAP End-to-End afin d'exploiter plusieurs représentations textuelles, dans notre cas, des sorties caractères et des sorties consonnes/voyelles. Nous avons proposé une nouvelle technique de combinaisons des représentations textuelles pour l'amélioration des performances de reconnaissance.

Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.

How this classification was reachedexpand

Full frame distilled prediction

Teacher imitation

Not calibrated prevalence, not ground truth. Human validation pending. Learned from the 10,348 direct Codex labels and 10,348 direct Gemma labels. Candidate is the union of thresholded teacher heads; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels or direct frontier model labels.

metaresearch head score (Codex)0.002
metaresearch head score (Gemma)0.002
Version: codex-gemma-dda1882f352aValidation status: machine_predicted_unvalidated
Candidate categoriesMeta-epidemiology (narrow), Scholarly communication, Insufficient payload (model declined to judge)
Consensus categoriesMeta-epidemiology (narrow), Insufficient payload (model declined to judge)
DomainCandidate signal: none · Consensus signal: none
Study designCandidate signal: Other design · Consensus signal: none
GenreCandidate signal: Empirical · Consensus signal: none
Teacher disagreement score0.975
Threshold uncertainty score1.000

Codex and Gemma teacher scores by category

CategoryCodexGemma
Metaresearch0.0020.002
Meta-epidemiology (narrow)0.0010.001
Meta-epidemiology (broad)0.0020.001
Bibliometrics0.0010.001
Science and technology studies0.0000.000
Scholarly communication0.0020.001
Open science0.0030.003
Research integrity0.0010.001
Insufficient payload (model declined to judge)0.0200.018

Machine scores (provisional)

The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.

Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.

Opus teacher head0.078
GPT teacher head0.271
Teacher spread0.193 · how far apart the two teachers sit on this one work
Validation statusscore_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from it

Classification

machine, unvalidated

Machine predicted; both teacher heads agree on what is shown here.

Study designOther design
Domainnot available
GenreEmpirical

How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".

Quick stats

Citations0
Published2021
Admission routes1
Has abstractyes

Explore more

Same venuetheses.fr (ABES)Same topicSpeech Recognition and SynthesisFrench-language works237,207