A study of the reliability and validity of the standardized exams used in grade 10 science in a Winnipeg school division
Notice bibliographique
Résumé
The purpose of this study was to examine the reliability and validity of Grade 10 science exams administered in 2006 and2007 in a school division in the province of Manitoba.Over 1300 hundred grade 10 science students from five high schools participated in the study.The data was gathered from a secondary analysis of exam results using ExamSystem II software.A review of the examination policies in the division suggest the purpose of the grade 10 science exams did not change during the2006 and2007 testing years.In addition, a number of statistical analyses of the items in the four examinations showed that they were very similar in all four testing periods.The statistical analyses of the exams suggest that the change in the exam development process from 2006 to 2007 did not affect the quality of the exam or the achievement of the students.Finally, the analyses of the students' test scores suggest that the type of invigilation practice did not affect student achievement.In all respects, the standardized exams in the school division are viewed by the teachers, administrators, students, parents, and trustees as being an effective accountability instrument that provides reliable and valid information.There is, in addition, considerable evidence that these exams are important in developing divisional policies about the evaluation of students, and it is recommended that other divisions consider developing similar policies and procedures for assessing their students.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction distillée sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Apprise à partir de 10 348 étiquettes directes de Codex et de 10 348 étiquettes directes de Gemma. Le mode candidate est l'union des têtes enseignantes seuillées; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont ni des étiquettes humaines ni des étiquettes directes de modèles de pointe.
Scores Codex et Gemma par catégorie
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,002 | 0,000 |
| Méta-épidémiologie (sens strict) | 0,000 | 0,000 |
| Méta-épidémiologie (sens large) | 0,000 | 0,000 |
| Bibliométrie | 0,000 | 0,001 |
| Études des sciences et des technologies | 0,000 | 0,001 |
| Communication savante | 0,000 | 0,000 |
| Science ouverte | 0,001 | 0,000 |
| Intégrité de la recherche | 0,000 | 0,000 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,000 | 0,000 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule tête enseignante, pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».