MétaCan
Menu
Retour à la cohorte
Enregistrement W2582439330 · doi:10.1136/bmj.j14

Inter-rater agreement in evaluation of disability: systematic review of reproducibility studies

2017· review· en· W2582439330 sur OpenAlexaff
Jürgen Barth, W. E. L. de Boer, Jason W. Busse, Jan L. Hoving, Sarah Kedzia, Rachel Couban, Katrin Fischer, David Yoh von Allmen, Jerry Spanjer, Regina Kunz

Notice bibliographique

RevueBMJ · 2017
Typereview
Langueen
DomaineMedicine
ThématiqueMusculoskeletal pain and rehabilitation
Établissements canadiensMcMaster University
Organismes subventionnairesnon disponible
Mots-clésPsycINFOInter-rater reliabilityObservational studyInclusion (mineral)NormativeResearch designMEDLINEPsychologyDescriptive statisticsSystematic reviewMedicineApplied psychologyRating scaleMedical educationFamily medicineSocial psychologyStatisticsPathologyPolitical science

Résumé

récupéré en direct d'OpenAlex

OBJECTIVES: To explore agreement among healthcare professionals assessing eligibility for work disability benefits. DESIGN: Systematic review and narrative synthesis of reproducibility studies. DATA SOURCES: Medline, Embase, and PsycINFO searched up to 16 March 2016, without language restrictions, and review of bibliographies of included studies. ELIGIBILITY CRITERIA: Observational studies investigating reproducibility among healthcare professionals performing disability evaluations using a global rating of working capacity and reporting inter-rater reliability by a statistical measure or descriptively. Studies could be conducted in insurance settings, where decisions on ability to work include normative judgments based on legal considerations, or in research settings, where decisions on ability to work disregard normative considerations. : Teams of paired reviewers identified eligible studies, appraised their methodological quality and generalisability, and abstracted results with pretested forms. As heterogeneity of research designs and findings impeded a quantitative analysis, a descriptive synthesis stratified by setting (insurance or research) was performed. RESULTS: From 4562 references, 101 full text articles were reviewed. Of these, 16 studies conducted in an insurance setting and seven in a research setting, performed in 12 countries, met the inclusion criteria. Studies in the insurance setting were conducted with medical experts assessing claimants who were actual disability claimants or played by actors, hypothetical cases, or short written scenarios. Conditions were mental (n=6, 38%), musculoskeletal (n=4, 25%), or mixed (n=6, 38%). Applicability of findings from studies conducted in an insurance setting to real life evaluations ranged from generalisable (n=7, 44%) and probably generalisable (n=3, 19%) to probably not generalisable (n=6, 37%). Median inter-rater reliability among experts was 0.45 (range intraclass correlation coefficient 0.86 to κ-0.10). Inter-rater reliability was poor in six studies (37%) and excellent in only two (13%). This contrasts with studies conducted in the research setting, where the median inter-rater reliability was 0.76 (range 0.91-0.53), and 71% (5/7) studies achieved excellent inter-rater reliability. Reliability between assessing professionals was higher when the evaluation was guided by a standardised instrument (23 studies, P=0.006). No such association was detected for subjective or chronic health conditions or the studies' generalisability to real world evaluation of disability (P=0.46, 0.45, and 0.65, respectively). CONCLUSIONS: Despite their common use and far reaching consequences for workers claiming disabling injury or illness, research on the reliability of medical evaluations of disability for work is limited and indicates high variation in judgments among assessing professionals. Standardising the evaluation process could improve reliability. Development and testing of instruments and structured approaches to improve reliability in evaluation of disability are urgently needed.

Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.

Comment cette classification a été obtenuedéplier

Étiquettes directes de modèles (non validées)

Étiquettes de catégorie et de devis d'étude par modèle, issues des rondes d'étiquetage. C'est une sortie machine, non validée, et le désaccord entre modèles est livré comme donnée. Aucun devis ici n'est encore validé contre MEDLINE.

BrasCatégoriesDevis d'étudeConfiance
gemmaMétarecherche
Domaine: Reproductibilité · Genre: Synthèse
Porte sur le système de recherche canadien: non · Porte sur un sujet canadien: non
Revue systématiquelow
gptMétarecherche
Domaine: Méthodes · Genre: Synthèse
Porte sur le système de recherche canadien: non · Porte sur un sujet canadien: non
Revue systématiquehigh
modèles en accordL'accord compare des ensembles de catégories et des devis identiques entre les bras.

Prédiction distillée sur la base complète

Imitation des enseignants

Ni prévalence calibrée, ni vérité terrain. Validation humaine à venir. Apprise à partir de 10 348 étiquettes directes de Codex et de 10 348 étiquettes directes de Gemma. Le mode candidate est l'union des têtes enseignantes seuillées; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont ni des étiquettes humaines ni des étiquettes directes de modèles de pointe.

score de la tête « metaresearch » (Codex)0,046
score de la tête « metaresearch » (Gemma)0,057
Version: codex-gemma-dda1882f352aStatut de validation: machine_predicted_unvalidated
Catégories candidatesMétarecherche
Catégories consensuellesMétarecherche
DomaineSignal candidat: aucune · Signal consensuel: aucune
Devis d'étudeSignal candidat: Revue systématique · Signal consensuel: Revue systématique
GenreSignal candidat: Synthèse · Signal consensuel: Synthèse
Score de désaccord entre enseignants0,158
Score d'incertitude au seuil0,983

Scores Codex et Gemma par catégorie

CatégorieCodexGemma
Métarecherche0,0460,057
Méta-épidémiologie (sens strict)0,0000,000
Méta-épidémiologie (sens large)0,0050,001
Bibliométrie0,0000,000
Études des sciences et des technologies0,0000,000
Communication savante0,0000,000
Science ouverte0,0000,000
Intégrité de la recherche0,0000,000
Charge utile insuffisante (le modèle a refusé de juger)0,0000,000

Scores machine (provisoires)

Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.

Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.

Tête enseignante Opus0,301
Tête enseignante GPT0,537
Écart entre enseignants0,236 · la distance entre les deux têtes enseignantes sur ce seul travail
Statut de validationscore_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découle

Classification

machine, non validée

Étiqueté directement par 2 modèles lisant le dossier complet.

Devis d'étudeRevue systématique
DomaineReproductibilité · Méthodes
GenreSynthèse

Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».

En bref

Citations94
Publié2017
Routes d'admission1
Résumé présentoui

Explorer davantage

Même revueBMJMême sujetMusculoskeletal pain and rehabilitationCatégorieMétarechercheTravaux en français237 207