MétaCan
Menu
Retour à la cohorte
Enregistrement W2166025830 · doi:10.1186/1471-2288-14-45

Newcastle-Ottawa Scale: comparing reviewers’ to authors’ assessments

2014· article· en· W2166025830 sur OpenAlexafffundabout
Carson K. L. Lo, Dominik Mertz, Mark Loeb

Notice bibliographique

RevueBMC Medical Research Methodology · 2014
Typearticle
Langueen
DomaineDecision Sciences
ThématiqueMeta-analysis and systematic reviews
Établissements canadiensMcMaster UniversityUniversity of Toronto
Organismes subventionnairesHamilton Health Sciences FoundationMcMaster UniversityHamilton Health Sciences
Mots-clésInterquartile rangeConfidence intervalMedicineObservational studySystematic reviewMEDLINEReliability (semiconductor)Cohort studyFamily medicineInternal medicine

Résumé

récupéré en direct d'OpenAlex

BACKGROUND: Lack of appropriate reporting of methodological details has previously been shown to distort risk of bias assessments in randomized controlled trials. The same might be true for observational studies. The goal of this study was to compare the Newcastle-Ottawa Scale (NOS) assessment for risk of bias between reviewers and authors of cohort studies included in a published systematic review on risk factors for severe outcomes in patients infected with influenza. METHODS: Cohort studies included in the systematic review and published between 2008-2011 were included. The corresponding or first authors completed a survey covering all NOS items. Results were compared with the NOS assessment applied by reviewers of the systematic review. Inter-rater reliability was calculated using kappa (K) statistics. RESULTS: Authors of 65/182 (36%) studies completed the survey. The overall NOS score was significantly higher (p < 0.001) in the reviewers' assessment (median = 6; interquartile range [IQR] 6-6) compared with those by authors (median = 5, IQR 4-6). Inter-rater reliability by item ranged from slight (K = 0.15, 95% confidence interval [CI] = -0.19, 0.48) to poor (K = -0.06, 95% CI = -0.22, 0.10). Reliability for the overall score was poor (K = -0.004, 95% CI = -0.11, 0.11). CONCLUSIONS: Differences in assessment and low agreement between reviewers and authors suggest the need to contact authors for information not published in studies when applying the NOS in systematic reviews.

Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.

Comment cette classification a été obtenuedéplier

Prédiction machine sur la base complète

Imitation des enseignants

Ni prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.

score de la tête « metaresearch » (Codex)0,543
score de la tête « metaresearch » (Gemma)0,853
Version: metacan-v3-hybrid-931329e0061cStatut de validation: machine_predicted_unvalidated
Catégories candidatesMétarecherche
Catégories consensuellesMétarecherche
DomaineSignal candidat: Méthodes · Signal consensuel: aucune
Devis d'étudeSignal candidat: Observationnel · Signal consensuel: aucune
GenreSignal candidat: Empirique · Signal consensuel: aucune
Score de désaccord entre enseignants0,457
Score d'incertitude au seuil0,564

Scores du classifieur distillé par catégorie (deux têtes)

CatégorieCodexGemma
Métarecherche0,5430,853
Méta-épidémiologie (sens strict)0,0030,004
Méta-épidémiologie (sens large)0,0140,022
Bibliométrie0,0330,025
Études des sciences et des technologies0,0040,010
Communication savante0,0100,013
Science ouverte0,0100,010
Intégrité de la recherche0,0050,005
Charge utile insuffisante (le modèle a refusé de juger)0,0050,001

Scores machine (provisoires)

Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.

Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.

Tête enseignante Opus0,984
Tête enseignante GPT0,771
Écart entre enseignants0,213 · la distance entre les deux têtes enseignantes sur ce seul travail
Statut de validationscore_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découle

Classification

machine, non validée

Prédiction automatique; l’étiquette directe de Gemma et le classifieur distillé Codex s’accordent sur ce qui est montré ici.

Devis d'étudeObservationnel
DomaineMéthodes
GenreEmpirique

Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».

En bref

Citations2 472
Publié2014
Routes d'admission3
Résumé présentoui

Explorer davantage

Même revueBMC Medical Research MethodologyMême sujetMeta-analysis and systematic reviewsTravaux en français237 207