Systèmes d’accountability basés sur la performance : types, logiques instrumentales et effets sur l’efficacité et l’équité scolaires des systèmes éducatifs d’Europe et du Canada. Une étude comparative à partir des données PISA 2012
Bibliographic record
Abstract
L’accountability est devenue, dans les dernières décennies, la voie privilégiée d’une gouvernance renouvelée des systèmes d’éducation. Sous l’influence du New Public Management, l’introduction de systèmes d’accountability basés sur la performance (SABP) est envisagée comme une solution politique à la crise postulée des systèmes éducatifs. Les SABP devraient ainsi concourir à l’amélioration des performances des élèves et à la réduction des inégalités scolaires, néanmoins la littérature peine à voir émerger un consensus sur ces questions. Privilégiant une acception large, mais opérationnelle de l’accountability, prenant en compte les instruments mobilisés au sein des systèmes éducatifs pour réguler le fonctionnement des établissements scolaires sur base de leurs résultats, cette recherche quantitative comparative internationale analyse les effets des SABP sur les degrés d’efficacité et d’équité scolaires des systèmes éducatifs d’Europe et du Canada. L’étude repose sur une analyse secondaire des données du PISA 2012 et porte sur un échantillon de 59 systèmes d’éducation. Elle mobilise des analyses multi-variées (analyse en composantes principales, analyses de classification hiérarchique, ANOVA, régressions simples et multiples) pour d’une part caractériser les SABP dans les systèmes éducatifs d’Europe et du Canada et, d’autre part, analyser leurs effets sur l’efficacité et l’équité scolaires. Les résultats du premier volet de recherche font émerger trois logiques instrumentales au cœur des SABP : 1) une logique d’évaluation et de régulation selon la performance ; 2) une logique reposant sur la mise en place d’incitatifs directs pour les enseignants, 3) une logique articulant comparaison externe et dispositifs internes d’amélioration des performances des écoles. Sous-tendues par des instruments distincts, ces logiques s’articulent au sein de quatre types de SABP qui permettent de différencier les systèmes d’éducation d’Europe et du Canada : 1) une accountability de faible intensité et peu instrumentée, 2) une accountability axée principalement sur l’évaluation de la performance, 3) une accountability articulant suivi de la performance et comparaison externe/amélioration interne de la performance des établissements scolaires; 4) une accountability de forte intensité prévoyant des incitatifs directs pour les enseignants. Les résultats du second volet de recherche suggèrent que les effets des SABP sur l’efficacité et d’équité scolaire des systèmes éducatifs de l’échantillon sont, le cas échéant, faibles et s’annulent le plus souvent lorsque des facteurs clefs sont pris en compte (dépenses publiques en éducation, variation du niveau socioéconomique des élèves, stratification horizontale et verticale des systèmes scolaires). Si la mise en place d’incitatifs pour le corps enseignants, et le type de SABP privilégiant ce type de dispositifs, apparaissent significativement liés à des degrés d’efficacité scolaire plus faibles, d’inégalités de résultats et des acquis de base plus élevés, nos résultats invitent finalement à dresser un constat plus que mitigé quant à la capacité des SABP à tenir leurs promesses d’efficacité et d’équité scolaires.
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame machine prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.
Distilled classifier scores by category (both heads)
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.027 | 0.091 |
| Meta-epidemiology (narrow) | 0.001 | 0.000 |
| Meta-epidemiology (broad) | 0.001 | 0.001 |
| Bibliometrics | 0.005 | 0.010 |
| Science and technology studies | 0.004 | 0.005 |
| Scholarly communication | 0.009 | 0.004 |
| Open science | 0.001 | 0.005 |
| Research integrity | 0.001 | 0.002 |
| Insufficient payload (model declined to judge) | 0.007 | 0.001 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".