Vérification de la pléiotropie en randomisation mendélienne : évaluation méthodologique et application à l'estimation de l'effet causal de l'adiposité sur la pression artérielle
Notice bibliographique
Résumé
Introduction La randomisation mendélienne (RM) est une approche de plus en plus populaire dans les études observationnelles qui utilise des variants génétiques (habituellement des polymorphismes mononucléotidiques ou single-nucleotide polymorphisms, SNPs) associés à une exposition (hypothèse 1 ou pertinence) comme instruments pour estimer l’effet causal de cette exposition sur une issue, en assumant l’absence de confusion entre l’instrument et l’issue (hypothèse 2 ou indépendance) et l’absence d’un effet de l’instrument sur l’issue en dehors de l’exposition (hypothèse 3 ou restriction d’exclusion). Cependant, la validité des résultats de la RM est menacée par la pléiotropie, phénomène biologique par lequel un SNP affecte distinctement l’exposition et l’issue, qui est l’une des principales causes de violation de la restriction d’exclusion. Cette thèse examine certains défis méthodologiques pratiques de la RM relatifs à la vérification de la restriction d’exclusion et à la validité des résultats à travers trois principaux objectifs : 1) cartographier comment les chercheurs en RM préviennent, détectent et/ou contrôlent, et discutent des violations potentielles de la restriction d'exclusion dues notamment à la pléiotropie ; 2) évaluer la performance de la méthode basée sur la confusion positive, qui compare les estimés ponctuels de l’effet de l’exposition sur l’issue obtenus par la RM et par la régression conventionnelle, dans la détection des instruments invalides dans plusieurs contextes pratiques d’études de RM ; et 3) examiner l’impact des méthodes courantes de gestion de la médication antihypertensive dans les études de RM modélisant la pression artérielle (PA) sur l'estimation de l’effet causal et la détection des violations potentielles de la restriction d'exclusion. Méthodes Pour l’objectif 1, une revue de littérature de 128 études de RM ayant utilisé au moins un SNP sur le gène FTO (fat mass and obesity-associated) comme instrument de l’indice de masse corporelle (IMC) a été réalisée. La façon dont les auteurs préviennent, évaluent ou contrôlent, et discutent des violations potentielles de la restriction d’exclusion dues notamment à la pléiotropie a été examinée. Pour l’objectif 2, une étude de simulation statistique considérant des contextes d’études de RM utilisant comme instrument un SNP ou un score de risque génétique (genetic risk score, GRS), une issue continue ou binaire, dans des scénarios évaluant l’impact de la taille de l’échantillon et du type de pléiotropie (indirect ou direct), a été réalisée. La performance de la méthode basée sur la confusion positive a été définie comme le pourcentage de jeux de données simulés dans lesquels la méthode détectait des instruments invalides. Pour l’objectif 3, une étude de RM de l’association entre l’IMC et la PA systolique (PAS) a été réalisée. Les méthodes de gestion de la médication antihypertensive examinées étaient : (i) pas de correction, (ii) inclure la médication dans les modèles comme une covariable d’ajustement, (iii) exclure de l’analyse les sujets traités aux antihypertenseurs, (iv) ajouter une valeur constante de 15 mm Hg aux valeurs mesurées de la PAS chez les sujets traités aux antihypertenseurs, et (v) utiliser comme issue un indicateur binaire de l'hypertension. Résultats Il existe une pléthore de méthodes utilisées dans les études de RM dont certaines peuvent être sous-optimales à prévenir, détecter ou contrôler le biais dû à l’inclusion des SNPs pléiotropiques. Les simulations statistiques montrent qu’en RM utilisant un SNP comme instrument, la méthode basée sur la confusion positive est performante à détecter l’invalidité de l’instrument lorsque la pléiotropie est directe plutôt qu’indirecte, indépendamment de l’issue, mais la performance de la méthode s’améliore avec l’augmentation de taille de l’échantillon. En revanche, la méthode est moins performante à détecter l’invalidité lorsque l’instrument est un GRS, mais sa performance augmente avec la proportion des SNPs invalides inclus dans le GRS. Enfin, les estimations de la RM varient énormément selon la stratégie de gestion de la médication antihypertensive choisie, contrairement à la détection des violations de la restriction d’exclusion qui n’en est pas affectée. Conclusion Cette thèse met de l’avant certaines difficultés méthodologiques dans les applications de la RM et l’importance de la triangulation de plusieurs méthodes dans la vérification des hypothèses de RM. Le champ de la RM est en plein essor, et des nouvelles méthodes sont souvent proposées. Il devient important non seulement de les évaluer, mais aussi d’en détailler l’utilisation et les hypothèses sous-jacentes pour une utilisation optimale en complément aux méthodes existantes.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction machine sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.
Scores du classifieur distillé par catégorie (deux têtes)
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,235 | 0,497 |
| Méta-épidémiologie (sens strict) | 0,002 | 0,001 |
| Méta-épidémiologie (sens large) | 0,003 | 0,006 |
| Bibliométrie | 0,002 | 0,002 |
| Études des sciences et des technologies | 0,001 | 0,003 |
| Communication savante | 0,004 | 0,003 |
| Science ouverte | 0,003 | 0,003 |
| Intégrité de la recherche | 0,003 | 0,004 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,009 | 0,001 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».