Système de recommandations vidéo fondé sur l’analyse des sous-titres dans le but de soutenir le développement linguistique d’enfants autistes
Notice bibliographique
Résumé
Il a été remarqué que par l’exposition à des vidéos comportant des lettres, des chiffres, des formes, l’enfant autiste d’âge préscolaire et le plus souvent non ou minimalement verbal, atteint rapidement grâce à cette exposition une connaissance autodidacte du code écrit ainsi qu’un vocabulaire qui facilitent sa scolarisation plusieurs années plus tard. Le programme de recherche dans lequel s’inscrit ce projet est d’en arriver à développer un système de recommandations vidéo multimodal et personnalisé qui soutiendra leur progrès linguistique ainsi que de concevoir une base de données sur l’évolution du développement du langage chez ces enfants. \n \nConcrètement, ce projet consiste à développer un système de recommandation fondé sur les sous-titres des vidéos de manière à pouvoir, par la suite, intégrer des caractéristiques extraites d’autres signaux comme les couleurs, les objets, les sons, afin de mieux cerner les centres d'intérêts de l’enfant pour ainsi personnaliser davantage les recommandations. Pour y arriver, nous avons développé un cadriciel d’optimisation comportant une étape d’évaluation approfondie de la stabilité de la paramétrisation du modèle LDA. Nous l’avons ensuite utilisé pour modéliser un corpus constitué de transcriptions automatiques provenant de vidéo pour enfant offert sur YouTube. À l’aide de cette modélisation des sous-titres, nous avons développé un système de recommandations et une interface illustrant l’évolution de l’estimation des centres d’intérêt à travers les thématiques décrivant les sous-titres des vidéos (carte sémantique). Afin de valider la qualité du modèle optimisé, des calculs de recommandations et du potentiel descriptif de la carte sémantique, nous avons conçu une application web afin d’effectuer une première évaluation de ce système à l’aide de participants issus de la communauté universitaire. \n \nÀ la suite des différentes expérimentations, l’analyse des résultats concernant le cadriciel d’optimisation démontre l’importance de l’analyse en stabilité pour sélectionner une modélisation quasi optimale au lieu de s'appuyer aveuglément sur des procédures dirigées par des métaheuristiques. Concernant l’évaluation du système de recommandations, les résultats démontrent le potentiel d’utiliser LDA comme base de calcul pour concevoir un système de recommandations. En ce qui concerne la carte sémantique, elle a suscité l’intérêt des participants à vouloir l’adopter dans un contexte de recherche et de sélection de vidéos. Finalement, les participants admettent la pertinence d’y visualiser l’évolution de leur centre d’intérêt ainsi que sa particularité à décrire le contenu des vidéos qu’ils ont aimées.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction machine sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.
Scores du classifieur distillé par catégorie (deux têtes)
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,003 | 0,018 |
| Méta-épidémiologie (sens strict) | 0,001 | 0,001 |
| Méta-épidémiologie (sens large) | 0,001 | 0,001 |
| Bibliométrie | 0,002 | 0,001 |
| Études des sciences et des technologies | 0,001 | 0,001 |
| Communication savante | 0,002 | 0,005 |
| Science ouverte | 0,001 | 0,002 |
| Intégrité de la recherche | 0,002 | 0,002 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,017 | 0,009 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».