Reclaiming the archive: Mobilizing textual sources to create an ininīmowin (Swampy Cree) dictionary.
Notice bibliographique
Résumé
Ce mémoire présente une méthodologie pour l’élaboration d’un dictionnaire de l’ininīmowin (cri des marais) et expose ce que signifie la littératie en langue autochtone pour l’ininīmowin et d’autres langues autochtones au XXIᵉ siècle. L’ininīmowin est parlé dans le centre-nord du Manitoba par les ininiwak (peuple cri des marais). Cette langue a façonné les valeurs et les épistémologies à travers lesquelles les ininiwak ont compris leur place dans le monde. Pendant des millénaires, l’ininīmowin s’est épanoui dans le nord du Manitoba. Le premier contact avec les Européens, à la fin du XVIIᵉ siècle, a mené à l’établissement de la traite des fourrures au Manitoba au début du XVIIIᵉ siècle. Les ininiwak ont interagi avec les mistikōsiwak (personnes allochtones), ce qui a facilité l’adaptation des colons à ces territoires. Au début du XIXᵉ siècle, ces relations ont évolué vers des efforts européens pour « civiliser » les peuples autochtones. Cela comprenait des initiatives systématiques pour convertir les peuples autochtones au christianisme par l’évangélisation dans leurs langues locales, ce qui a entrainé la création de documents primaires en ininīmowin, tels que des bibles, des recueils de cantiques et des dictionnaires en ininīmowin et dans des dialectes voisins (comme le nēhiyawēwin). La conversion au christianisme faisait partie d’un projet colonial européen dont l’objectif principal était d’assimiler les ininiwak et d’autres peuples autochtones du Canada à la société eurocanadienne dominante, en effaçant graduellement leurs cultures et leurs langues. En conséquence, des politiques coloniales comme la Loi sur les Indiens, 1876 ont institué le système des pensionnats indiens et interdit aux enfants autochtones de parler leurs langues pendant plus d’un siècle, contribuant ainsi directement au changement linguistique et à l’adoption forcée de l’anglais et du français au Canada. Ces dernières décennies, la lexicographie autochtone s’est concentrée sur la réappropriation des savoirs traditionnels. Comme l’ininīmowin n’était pas historiquement une langue écrite, les textes créés à l’origine pour évangéliser et convertir les peuples autochtones constituent aujourd’hui, de manière paradoxale, les sources primaires les plus vieilles pour la revitalisation linguistique. Utiliser ces sources pour enseigner et (ré)apprendre les langues et cultures autochtones est devenu un aspect central du domaine de la revitalisation des langues autochtones. Un travail lexicographique approfondi menant à la création d’un dictionnaire de l’ininīmowin contribuera aux efforts visant à récupérer ces archives, en analysant minutieusement les corpus et en standardisant les entrées du dictionnaire. Ces sources, qui s’étendent sur environ trois siècles, témoignent d’une façon de parler plus ancienne. Un dictionnaire contemporain s’appuyant à la fois sur les textes historiques et sur les savoirs des locuteurs et des Aînés encore vivants garantira que l’ininīmowin soit consigné par écrit et jouera un rôle crucial dans les initiatives actuelles de revitalisation des langues autochtones. Cela permettra à toutes les personnes apprenant l’ininīmowin aujourd’hui d’avoir accès à une langue écrite de grande qualité respectant l’orthographe romaine standard, qu’elles aient ou non des locuteurs dans leur entourage. De plus, cela garantira la protection de notre langue, des mots contenus dans ces sources et de notre culture pour les générations futures
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction machine sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.
Scores du classifieur distillé par catégorie (deux têtes)
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,007 | 0,028 |
| Méta-épidémiologie (sens strict) | 0,001 | 0,001 |
| Méta-épidémiologie (sens large) | 0,001 | 0,000 |
| Bibliométrie | 0,010 | 0,009 |
| Études des sciences et des technologies | 0,004 | 0,004 |
| Communication savante | 0,010 | 0,016 |
| Science ouverte | 0,002 | 0,009 |
| Intégrité de la recherche | 0,001 | 0,002 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,018 | 0,007 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».