MétaCan
Menu
Retour à la cohorte
Enregistrement W2036060563 · doi:10.1186/1471-2288-10-82

Inter-rater agreement and reliability of the COSMIN (COnsensus-based Standards for the selection of health status Measurement Instruments) Checklist

2010· article· en· W2036060563 sur OpenAlexafffund
Lidwine B. Mokkink, Caroline B. Terwee, Elizabeth Gibbons, Paul W. Stratford, Jordi Alonso, Donald L. Patrick, Dirk L. Knol, L.M. Bouter, Henrica C. W. de Vet

Notice bibliographique

RevueBMC Medical Research Methodology · 2010
Typearticle
Langueen
DomaineDecision Sciences
ThématiqueReliability and Agreement in Measurement
Établissements canadiensMcMaster University
Organismes subventionnairesVrije Universiteit AmsterdamUniversity of OxfordMcMaster UniversityGoddard Space Flight CenterUniversity of Washington
Mots-clésChecklistKappaInter-rater reliabilityIntraclass correlationCohen's kappaReliability (semiconductor)MedicineQuality (philosophy)AgreementTerminologyPsychologyApplied psychologyPhysical therapyMedical physicsClinical psychologyStatisticsPsychometricsRating scaleMathematics

Résumé

récupéré en direct d'OpenAlex

BACKGROUND: The COSMIN checklist is a tool for evaluating the methodological quality of studies on measurement properties of health-related patient-reported outcomes. The aim of this study is to determine the inter-rater agreement and reliability of each item score of the COSMIN checklist (n = 114). METHODS: 75 articles evaluating measurement properties were randomly selected from the bibliographic database compiled by the Patient-Reported Outcome Measurement Group, Oxford, UK. Raters were asked to assess the methodological quality of three articles, using the COSMIN checklist. In a one-way design, percentage agreement and intraclass kappa coefficients or quadratic-weighted kappa coefficients were calculated for each item. RESULTS: 88 raters participated. Of the 75 selected articles, 26 articles were rated by four to six participants, and 49 by two or three participants. Overall, percentage agreement was appropriate (68% was above 80% agreement), and the kappa coefficients for the COSMIN items were low (61% was below 0.40, 6% was above 0.75). Reasons for low inter-rater agreement were need for subjective judgement, and accustom to different standards, terminology and definitions. CONCLUSIONS: Results indicated that raters often choose the same response option, but that it is difficult on item level to distinguish between articles. When using the COSMIN checklist in a systematic review, we recommend getting some training and experience, completing it by two independent raters, and reaching consensus on one final rating. Instructions for using the checklist are improved.

Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.

Comment cette classification a été obtenuedéplier

Prédiction machine sur la base complète

Imitation des enseignants

Ni prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.

score de la tête « metaresearch » (Codex)0,436
score de la tête « metaresearch » (Gemma)0,564
Version: metacan-v3-hybrid-931329e0061cStatut de validation: machine_predicted_unvalidated
Catégories candidatesMétarecherche
Catégories consensuellesMétarecherche
DomaineSignal candidat: Méthodes · Signal consensuel: aucune
Devis d'étudeSignal candidat: Observationnel · Signal consensuel: Observationnel
GenreSignal candidat: Empirique · Signal consensuel: Empirique
Score de désaccord entre enseignants0,564
Score d'incertitude au seuil0,696

Scores du classifieur distillé par catégorie (deux têtes)

CatégorieCodexGemma
Métarecherche0,4360,564
Méta-épidémiologie (sens strict)0,0010,001
Méta-épidémiologie (sens large)0,0050,007
Bibliométrie0,0200,010
Études des sciences et des technologies0,0030,003
Communication savante0,0040,003
Science ouverte0,0030,006
Intégrité de la recherche0,0020,002
Charge utile insuffisante (le modèle a refusé de juger)0,0020,001

Scores machine (provisoires)

Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.

Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.

Tête enseignante Opus0,595
Tête enseignante GPT0,567
Écart entre enseignants0,028 · la distance entre les deux têtes enseignantes sur ce seul travail
Statut de validationscore_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découle

Classification

machine, non validée

Prédiction automatique; l’étiquette directe de Gemma et le classifieur distillé Codex s’accordent sur ce qui est montré ici.

Devis d'étudeObservationnel
DomaineMéthodes
GenreEmpirique

Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».

En bref

Citations289
Publié2010
Routes d'admission2
Résumé présentoui

Explorer davantage

Même revueBMC Medical Research MethodologyMême sujetReliability and Agreement in MeasurementTravaux en français237 207