MétaCan
Menu
Retour à la cohorte
Enregistrement W2946571535 · doi:10.1186/s12874-019-0737-5

The utility of multivariate outlier detection techniques for data quality evaluation in large studies: an application within the ONDRI project

2019· article· en· W2946571535 sur OpenAlexafffundabout
Kelly M. Sunderland, Derek Beaton, Julia Fraser, Donna Kwan, Paula McLaughlin, Manuel Montero‐Odasso, Alicia Peltsch, Frederico Pieruccini‐Faria, Demetrios J. Sahlas, Richard H. Swartz, Stephen C. Strother, Malcolm A. Binns

Notice bibliographique

RevueBMC Medical Research Methodology · 2019
Typearticle
Langueen
DomaineMedicine
ThématiqueDementia and Cognitive Impairment Research
Établissements canadiensPublic Health OntarioCanada Research ChairsHealth Sciences CentreUniversity of New BrunswickUniversity of TorontoWestern UniversitySunnybrook Health Science CentreLawson Health Research InstituteParkwood InstituteUniversity of WaterlooMcMaster UniversityBaycrest Hospital
Organismes subventionnairesOntario Ministry of Research and InnovationWestern UniversityUniversity of TorontoStrongCanadian Institutes of Health ResearchSunnybrook Research InstituteOntario Brain InstituteOntario Ministry of Research, Innovation and ScienceHeart and Stroke Foundation of Canada
Mots-clésMultivariate statisticsComputer scienceOutlierMultivariate analysisData miningAnomaly detectionData scienceQuality (philosophy)Data qualityInformation retrievalMachine learningArtificial intelligenceOperations managementEngineering

Résumé

récupéré en direct d'OpenAlex

BACKGROUND: Large and complex studies are now routine, and quality assurance and quality control (QC) procedures ensure reliable results and conclusions. Standard procedures may comprise manual verification and double entry, but these labour-intensive methods often leave errors undetected. Outlier detection uses a data-driven approach to identify patterns exhibited by the majority of the data and highlights data points that deviate from these patterns. Univariate methods consider each variable independently, so observations that appear odd only when two or more variables are considered simultaneously remain undetected. We propose a data quality evaluation process that emphasizes the use of multivariate outlier detection for identifying errors, and show that univariate approaches alone are insufficient. Further, we establish an iterative process that uses multiple multivariate approaches, communication between teams, and visualization for other large-scale projects to follow. METHODS: We illustrate this process with preliminary neuropsychology and gait data for the vascular cognitive impairment cohort from the Ontario Neurodegenerative Disease Research Initiative, a multi-cohort observational study that aims to characterize biomarkers within and between five neurodegenerative diseases. Each dataset was evaluated four times: with and without covariate adjustment using two validated multivariate methods - Minimum Covariance Determinant (MCD) and Candès' Robust Principal Component Analysis (RPCA) - and results were assessed in relation to two univariate methods. Outlying participants identified by multiple multivariate analyses were compiled and communicated to the data teams for verification. RESULTS: Of 161 and 148 participants in the neuropsychology and gait data, 44 and 43 were flagged by one or both multivariate methods and errors were identified for 8 and 5 participants, respectively. MCD identified all participants with errors, while RPCA identified 6/8 and 3/5 for the neuropsychology and gait data, respectively. Both outperformed univariate approaches. Adjusting for covariates had a minor effect on the participants identified as outliers, though did affect error detection. CONCLUSIONS: Manual QC procedures are insufficient for large studies as many errors remain undetected. In these data, the MCD outperforms the RPCA for identifying errors, and both are more successful than univariate approaches. Therefore, data-driven multivariate outlier techniques are essential tools for QC as data become more complex.

Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.

Comment cette classification a été obtenuedéplier

Prédiction distillée sur la base complète

Imitation des enseignants

Ni prévalence calibrée, ni vérité terrain. Validation humaine à venir. Apprise à partir de 10 348 étiquettes directes de Codex et de 10 348 étiquettes directes de Gemma. Le mode candidate est l'union des têtes enseignantes seuillées; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont ni des étiquettes humaines ni des étiquettes directes de modèles de pointe.

score de la tête « metaresearch » (Codex)0,278
score de la tête « metaresearch » (Gemma)0,186
Version: codex-gemma-dda1882f352aStatut de validation: machine_predicted_unvalidated
Catégories candidatesMétarecherche
Catégories consensuellesMétarecherche
DomaineSignal candidat: aucune · Signal consensuel: aucune
Devis d'étudeSignal candidat: Autre devis · Signal consensuel: aucune
GenreSignal candidat: Empirique · Signal consensuel: Empirique
Score de désaccord entre enseignants0,856
Score d'incertitude au seuil0,821

Scores Codex et Gemma par catégorie

CatégorieCodexGemma
Métarecherche0,2780,186
Méta-épidémiologie (sens strict)0,0000,000
Méta-épidémiologie (sens large)0,0000,000
Bibliométrie0,0000,001
Études des sciences et des technologies0,0000,001
Communication savante0,0000,000
Science ouverte0,0010,001
Intégrité de la recherche0,0000,001
Charge utile insuffisante (le modèle a refusé de juger)0,0000,000

Scores machine (provisoires)

Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.

Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.

Tête enseignante Opus0,755
Tête enseignante GPT0,685
Écart entre enseignants0,070 · la distance entre les deux têtes enseignantes sur ce seul travail
Statut de validationscore_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découle

Classification

machine, non validée

Prédiction automatique; les deux têtes enseignantes s’accordent sur ce qui est montré ici.

Devis d'étudeAutre devis
Domainenon disponible
GenreEmpirique

Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».

En bref

Citations72
Publié2019
Routes d'admission3
Résumé présentoui

Explorer davantage

Même revueBMC Medical Research MethodologyMême sujetDementia and Cognitive Impairment ResearchTravaux en français237 207