Grade Scaling: Issues and Approaches
Notice bibliographique
Résumé
The need for grade scaling typically emerges in the context of an assessment of student work based on relatively objective or fixed subjective criteria that produces a distribution of results that the instructor believes to be problematic in some sense; e.g., a multiple-choice test in which a large enough proportion of the students did so poorly that, left unscaled, it is likely to deter them from putting further effort into the course.Even instructors who believe that grade scaling is pedagogically unsound may, from time to time, be faced with the practical reality that, all things considered, it is a necessary evil.As such, a good understanding of the options that instructors have open to them in this matter would seem to be essential.In this paper, I discuss issues surrounding the scaling of grades as well as the relative merits of different approaches to doing so.The main issue dealt with concerns the justification for grade scaling on pedagogical grounds.This takes us some distance in establishing a set of axioms that inform the choice of a general approach to grade scaling.Next, I show that, among seven different approaches, including five that are fairly well known and one that is entirely new, only the latter satisfies all of the axioms.Finally, I show that the new approach can be used as a "self-scaling" technique for adjusting course grades to reflect class participation in a manner that is non-detrimental to students who reach a minimum standard and differentially beneficial to students who are closer to the pass-fail boundary (relative to those who are further from it, in either direction) on the basis of the other required elements of the course.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction distillée sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Apprise à partir de 10 348 étiquettes directes de Codex et de 10 348 étiquettes directes de Gemma. Le mode candidate est l'union des têtes enseignantes seuillées; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont ni des étiquettes humaines ni des étiquettes directes de modèles de pointe.
Scores Codex et Gemma par catégorie
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,000 | 0,000 |
| Méta-épidémiologie (sens strict) | 0,000 | 0,000 |
| Méta-épidémiologie (sens large) | 0,000 | 0,000 |
| Bibliométrie | 0,001 | 0,001 |
| Études des sciences et des technologies | 0,003 | 0,002 |
| Communication savante | 0,000 | 0,003 |
| Science ouverte | 0,001 | 0,000 |
| Intégrité de la recherche | 0,000 | 0,000 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,000 | 0,000 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule tête enseignante, pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».