Developpement d'une strategie de testing informatisee et interactive, centree sur le diagnostic pedagogique dans le contexte de la classe
Bibliographic record
Abstract
Ce mémoire présente le développement d'une stratégie de testing informatisée et interactive, centrée sur le diagnostic pédagogique dans le contexte de la classe. La nouvelle stratégie d'administration d'un test a été intégrée à un système de tests adaptatifs existant, conçu pour répondre à un besoin d'outils pour revaluation formative qui respectent les contraintes organisationnelles du milieu scolaire québécois. Le système développé a pour but de renseigner rapidement renseignant et l'élève de l'état des apprentissages de celui-ci sans délai, afin que renseignant puisse entreprendre des interventions correctives efficaces auprès des élèves. Le système de tests réalisé administre un test en deux phases. La première phase fournit un diagnostic structurel ainsi qu'une hypothèse du diagnostic causal reflétant les apprentissages d'un élève. La seconde phase du test permet d'établir un niveau de cohérence d'un élève présentant une difficulté cognitive préalablement identifiée dans la première phase et de communiquer ce diagnostic causal sous la forme d'un message qualitatif pour renseignant. Pour répondre aux objectifs de la première phase du test, nous avons modifié la programmation de la stratégie "stradaptative" existante pour la rendre plus flexible et indépendante des banques d'items. Nous avons procédé à la verification de l'algorithme de sélection des items "stradaptatif" par une étude de vérification simulant différents profils d'élèves. Pour répondre aux objectifs de la seconde phase, nous avons convenu d'utiliser la catégorie de leurres la plus fréquemment choisie par l'élève lors de la première phase du test comme élément d'information pour la seconde phase. Nous avons ajouté au système de tests diagnostiques existant, une stratégie de selection adaptative des items selon un modèle Rasch nécessaire pour estimer le niveau de difficulté cognitive de l'élève face à une catégorie de leurres donnée. n IV Nous avons établi, à partir des résultats des études de simulations, des intervalles de confiance pour les thêta moyens estimés correspondant à des niveaux de difficulté cognitive et des profils d'élèves différents. A partir de ces intervalles, nous avons défini trois niveaux de messages diagnostiques exprimant le niveau de cohérence de l'élève à choisir une catégorie de leurres donnée : la difficulté n'est pas cohérente, la difficulté présente un certain degré de cohérence, la difficulté est cohérente. Le diagnostic structurel et le diagnostic causal sont accessibles immédiatement après la passation du test par l'entremise de la fiche diagnostique individuelle de l'élève. Cette recherche a permis d'intégrer dans un même système de tests, la stratégie "stradaptative" dont la programmation a été rendue indépendante du contenu des banques et une stratégie complémentaire de sélection des items utilisant le modèle de Rasch qui permet de déterminer un niveau de cohérence de l'élève à choisir une certaine catégorie de leurres.
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame machine prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.
Distilled classifier scores by category (both heads)
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.019 | 0.046 |
| Meta-epidemiology (narrow) | 0.002 | 0.001 |
| Meta-epidemiology (broad) | 0.001 | 0.002 |
| Bibliometrics | 0.003 | 0.002 |
| Science and technology studies | 0.002 | 0.003 |
| Scholarly communication | 0.008 | 0.006 |
| Open science | 0.003 | 0.004 |
| Research integrity | 0.003 | 0.003 |
| Insufficient payload (model declined to judge) | 0.015 | 0.004 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".