Reclaiming the archive: Mobilizing textual sources to create an ininīmowin (Swampy Cree) dictionary.
Bibliographic record
Abstract
Ce mémoire présente une méthodologie pour l’élaboration d’un dictionnaire de l’ininīmowin (cri des marais) et expose ce que signifie la littératie en langue autochtone pour l’ininīmowin et d’autres langues autochtones au XXIᵉ siècle. L’ininīmowin est parlé dans le centre-nord du Manitoba par les ininiwak (peuple cri des marais). Cette langue a façonné les valeurs et les épistémologies à travers lesquelles les ininiwak ont compris leur place dans le monde. Pendant des millénaires, l’ininīmowin s’est épanoui dans le nord du Manitoba. Le premier contact avec les Européens, à la fin du XVIIᵉ siècle, a mené à l’établissement de la traite des fourrures au Manitoba au début du XVIIIᵉ siècle. Les ininiwak ont interagi avec les mistikōsiwak (personnes allochtones), ce qui a facilité l’adaptation des colons à ces territoires. Au début du XIXᵉ siècle, ces relations ont évolué vers des efforts européens pour « civiliser » les peuples autochtones. Cela comprenait des initiatives systématiques pour convertir les peuples autochtones au christianisme par l’évangélisation dans leurs langues locales, ce qui a entrainé la création de documents primaires en ininīmowin, tels que des bibles, des recueils de cantiques et des dictionnaires en ininīmowin et dans des dialectes voisins (comme le nēhiyawēwin). La conversion au christianisme faisait partie d’un projet colonial européen dont l’objectif principal était d’assimiler les ininiwak et d’autres peuples autochtones du Canada à la société eurocanadienne dominante, en effaçant graduellement leurs cultures et leurs langues. En conséquence, des politiques coloniales comme la Loi sur les Indiens, 1876 ont institué le système des pensionnats indiens et interdit aux enfants autochtones de parler leurs langues pendant plus d’un siècle, contribuant ainsi directement au changement linguistique et à l’adoption forcée de l’anglais et du français au Canada. Ces dernières décennies, la lexicographie autochtone s’est concentrée sur la réappropriation des savoirs traditionnels. Comme l’ininīmowin n’était pas historiquement une langue écrite, les textes créés à l’origine pour évangéliser et convertir les peuples autochtones constituent aujourd’hui, de manière paradoxale, les sources primaires les plus vieilles pour la revitalisation linguistique. Utiliser ces sources pour enseigner et (ré)apprendre les langues et cultures autochtones est devenu un aspect central du domaine de la revitalisation des langues autochtones. Un travail lexicographique approfondi menant à la création d’un dictionnaire de l’ininīmowin contribuera aux efforts visant à récupérer ces archives, en analysant minutieusement les corpus et en standardisant les entrées du dictionnaire. Ces sources, qui s’étendent sur environ trois siècles, témoignent d’une façon de parler plus ancienne. Un dictionnaire contemporain s’appuyant à la fois sur les textes historiques et sur les savoirs des locuteurs et des Aînés encore vivants garantira que l’ininīmowin soit consigné par écrit et jouera un rôle crucial dans les initiatives actuelles de revitalisation des langues autochtones. Cela permettra à toutes les personnes apprenant l’ininīmowin aujourd’hui d’avoir accès à une langue écrite de grande qualité respectant l’orthographe romaine standard, qu’elles aient ou non des locuteurs dans leur entourage. De plus, cela garantira la protection de notre langue, des mots contenus dans ces sources et de notre culture pour les générations futures
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame machine prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.
Distilled classifier scores by category (both heads)
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.007 | 0.028 |
| Meta-epidemiology (narrow) | 0.001 | 0.001 |
| Meta-epidemiology (broad) | 0.001 | 0.000 |
| Bibliometrics | 0.010 | 0.009 |
| Science and technology studies | 0.004 | 0.004 |
| Scholarly communication | 0.010 | 0.016 |
| Open science | 0.002 | 0.009 |
| Research integrity | 0.001 | 0.002 |
| Insufficient payload (model declined to judge) | 0.018 | 0.007 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".