Système de recommandations vidéo fondé sur l’analyse des sous-titres dans le but de soutenir le développement linguistique d’enfants autistes
Bibliographic record
Abstract
Il a été remarqué que par l’exposition à des vidéos comportant des lettres, des chiffres, des formes, l’enfant autiste d’âge préscolaire et le plus souvent non ou minimalement verbal, atteint rapidement grâce à cette exposition une connaissance autodidacte du code écrit ainsi qu’un vocabulaire qui facilitent sa scolarisation plusieurs années plus tard. Le programme de recherche dans lequel s’inscrit ce projet est d’en arriver à développer un système de recommandations vidéo multimodal et personnalisé qui soutiendra leur progrès linguistique ainsi que de concevoir une base de données sur l’évolution du développement du langage chez ces enfants. \n \nConcrètement, ce projet consiste à développer un système de recommandation fondé sur les sous-titres des vidéos de manière à pouvoir, par la suite, intégrer des caractéristiques extraites d’autres signaux comme les couleurs, les objets, les sons, afin de mieux cerner les centres d'intérêts de l’enfant pour ainsi personnaliser davantage les recommandations. Pour y arriver, nous avons développé un cadriciel d’optimisation comportant une étape d’évaluation approfondie de la stabilité de la paramétrisation du modèle LDA. Nous l’avons ensuite utilisé pour modéliser un corpus constitué de transcriptions automatiques provenant de vidéo pour enfant offert sur YouTube. À l’aide de cette modélisation des sous-titres, nous avons développé un système de recommandations et une interface illustrant l’évolution de l’estimation des centres d’intérêt à travers les thématiques décrivant les sous-titres des vidéos (carte sémantique). Afin de valider la qualité du modèle optimisé, des calculs de recommandations et du potentiel descriptif de la carte sémantique, nous avons conçu une application web afin d’effectuer une première évaluation de ce système à l’aide de participants issus de la communauté universitaire. \n \nÀ la suite des différentes expérimentations, l’analyse des résultats concernant le cadriciel d’optimisation démontre l’importance de l’analyse en stabilité pour sélectionner une modélisation quasi optimale au lieu de s'appuyer aveuglément sur des procédures dirigées par des métaheuristiques. Concernant l’évaluation du système de recommandations, les résultats démontrent le potentiel d’utiliser LDA comme base de calcul pour concevoir un système de recommandations. En ce qui concerne la carte sémantique, elle a suscité l’intérêt des participants à vouloir l’adopter dans un contexte de recherche et de sélection de vidéos. Finalement, les participants admettent la pertinence d’y visualiser l’évolution de leur centre d’intérêt ainsi que sa particularité à décrire le contenu des vidéos qu’ils ont aimées.
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame machine prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.
Distilled classifier scores by category (both heads)
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.003 | 0.018 |
| Meta-epidemiology (narrow) | 0.001 | 0.001 |
| Meta-epidemiology (broad) | 0.001 | 0.001 |
| Bibliometrics | 0.002 | 0.001 |
| Science and technology studies | 0.001 | 0.001 |
| Scholarly communication | 0.002 | 0.005 |
| Open science | 0.001 | 0.002 |
| Research integrity | 0.002 | 0.002 |
| Insufficient payload (model declined to judge) | 0.017 | 0.009 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".