MétaCan
Menu
Retour à la cohorte
Enregistrement W2886516149 · doi:10.1136/bmjebm-2018-111024.40

40 How fragile is the evidence base? a meta-epidemiologic study of the fragilityindex derived from 374 randomised trials

2018· article· en· W2886516149 sur OpenAlexaff
Riaz Qureshı, Desirée Sutton, Davy Cheng, Janet Martin

Notice bibliographique

Revuenon disponible
Typearticle
Langueen
DomaineEconomics, Econometrics and Finance
ThématiqueHealth Systems, Economic Evaluations, Quality of Life
Établissements canadiensWestern University
Organismes subventionnairesnon disponible
Mots-clésFragilityRandomized controlled trialMeta-analysisSample size determinationFalse positive paradoxMedicineStatisticsIndex (typography)Computer scienceMathematicsInternal medicine

Résumé

récupéré en direct d'OpenAlex

Background Recently, there has been increasing interest in addressing the problem of over-relying on threshold p values. Using p<0.05 represents a blunt arbiter of conclusions that are fraught with false positives and false negatives. Furthermore, questionable research practices are sometimes used to ‘game’ the p-value threshold in order to support the researchers’ preferred conclusions. Tools to highlight p-value shortcomings are required to improve interpretation of p-values. The Fragility Index has been proposed as a tool to highlight the ‘fragility’ of evidence derived from a threshold p-value. Objectives The primary objective of this study was to measure the fragility of conclusions from randomised trials (RCTs) published in the New England Journal of Medicine using the Fragility Index. Secondary objectives were to estimate the added impact of losses to follow-up on fragility, and to measure correlation between Fragility Index and standardised effect size, sample size, total number of events, and publication year. Method All RCTs of established practices that were published in the New England Journal of Medicine between 2000 to 2016 were included if they met the following criteria: (1) reported a dichotomous primary outcome; (2) had only two comparison groups; and (3) used a 1:1 randomization scheme. Data was extracted from each RCT in duplicate. The Fragility index was calculated by converting one patient in the group (control or experimental group) from a ‘non-event’ to an ‘event’ outcome and recalculating a two-sided Fisher’s exact test until the p-value meets or exceeds 0.05. This Fragility Index was calculated for trials with a significant primary outcome using a Fragility Index calculator, and the reverse Fragility Index for all trials with non-significant (p>0.05) outcomes using an R package. Loss to follow up was measured. Univariable linear regression was performed to assess the association between prespecified trial characteristics and the Fragility Index. Results Of 611 RCTs published in the New England Journal of Medicine between 2000 and 2016, a total of 374 met the inclusion criteria. The median Fragility Index was 7.5 (range 0 to 141). One-quarter of the trials had a Fragility Index of 3 or less. The number of patients lost to follow-up exceeded the Fragility Index in 66% (247/375) of the RCTs, indicating that the true Fragility Index would be even lower than reported if corrected for losses to follow-up. The Fragility Index was moderately correlated with the standardised effect size, and weakly correlated with sample size and year of publication. Sensitivity analyses did not reveal material differences when accounting for missing data. Conclusions Conclusions from RCTs that are based on p-values are very fragile, with a median of fewer than 8 additional events required to change the conclusion from significant to non-significant (or vice-versa). More than one-quarter of all trials would require only 3 additional events to change the conclusion. Furthermore, the majority of trials had a loss to follow-up that exceeded the Fragility Index, indicating that the results would be even more unstable if the Fragility Index was corrected for losses to follow-up. Efforts to increase awareness of the fragility of conclusions based on p-values is urgently required.

Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.

Comment cette classification a été obtenuedéplier

Étiquettes directes de modèles (non validées)

Étiquettes de catégorie et de devis d'étude par modèle, issues des rondes d'étiquetage. C'est une sortie machine, non validée, et le désaccord entre modèles est livré comme donnée. Aucun devis ici n'est encore validé contre MEDLINE.

BrasCatégoriesDevis d'étudeConfiance
gemmaMétarechercheMéta-épidémiologie (sens large)
Domaine: Méthodes · Genre: Empirique
Porte sur le système de recherche canadien: non · Porte sur un sujet canadien: non
Méta-analyselow
gptMétarechercheMéta-épidémiologie (sens strict)Méta-épidémiologie (sens large)
Domaine: Méthodes · Genre: Empirique
Porte sur le système de recherche canadien: non · Porte sur un sujet canadien: non
Méta-analysehigh
modèles en désaccordL'accord compare des ensembles de catégories et des devis identiques entre les bras.

Prédiction machine sur la base complète

Imitation des enseignants

Ni prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.

score de la tête « metaresearch » (Codex)0,299
score de la tête « metaresearch » (Gemma)0,614
Version: metacan-v3-hybrid-931329e0061cStatut de validation: machine_predicted_unvalidated
Catégories candidatesMétarecherche, Méta-épidémiologie (sens large)
Catégories consensuellesMétarecherche
DomaineSignal candidat: Méthodes · Signal consensuel: aucune
Devis d'étudeSignal candidat: Méta-analyse · Signal consensuel: Méta-analyse
GenreSignal candidat: Empirique · Signal consensuel: aucune
Score de désaccord entre enseignants0,988
Score d'incertitude au seuil0,864

Scores du classifieur distillé par catégorie (deux têtes)

CatégorieCodexGemma
Métarecherche0,2990,614
Méta-épidémiologie (sens strict)0,0030,003
Méta-épidémiologie (sens large)0,0120,046
Bibliométrie0,0140,013
Études des sciences et des technologies0,0020,003
Communication savante0,0070,008
Science ouverte0,0040,004
Intégrité de la recherche0,0050,005
Charge utile insuffisante (le modèle a refusé de juger)0,0070,001

Scores machine (provisoires)

Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.

Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.

Tête enseignante Opus0,790
Tête enseignante GPT0,493
Écart entre enseignants0,297 · la distance entre les deux têtes enseignantes sur ce seul travail
Statut de validationscore_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découle

Classification

machine, non validée

Étiqueté directement par 2 modèles lisant le dossier complet.

MétarechercheMéta-épidémiologie (sens large)Méta-épidémiologie (sens strict)

Les modèles divergent sur des parties de cette classification; chaque voix est préservée dans la section en fin de page.

Devis d'étudeMéta-analyse
DomaineMéthodes
GenreEmpirique

Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».

En bref

Citations0
Publié2018
Routes d'admission1
Résumé présentoui

Explorer davantage

Même sujetHealth Systems, Economic Evaluations, Quality of LifeCatégorieMétarechercheTravaux en français237 207