A gene association study to identify novel pancreatic cancer susceptibility genes
Bibliographic record
Abstract
Environ 10% des cancers du pancréas (CP) sont héréditaires. Cependant, peu d'entre eux sont expliqués par des gènes connus de susceptibilité au cancer. Les efforts récents pour identifier de nouveaux gènes de susceptibilité pour le CP ont été généralement infructueux, probablement à cause des limitations des méthodes utilisées quant à l'identification d'un « signal faible » dans une grande quantité de « bruit » causé par des variants non causaux. Ainsi, dans cette dissertation, j'ai teste l'hypothèse qu'un test d'association cas-contrôles par région, le Mixed-effects Score Test (MiST), va permettre d'identifier ces « signaux faibles ». En comparaison avec d'autres méthodes, MiST est une approche statistique peu biaisée qui compare la fréquence de mutation d'un gène ou d'une région entre les cas et les contrôles, tout en tenant compte des caractéristiques individuelles des variants. Dans les cas de CP, l'ADN extrait de lymphocytes en circulation ou de salive a été utilisé pour représenter l'ADN germinal. Notre série de cas consiste en 109 cas de CP à haut risque (cancer du pancréas familial ou âge au diagnostic <50) avec séquençage complet d'exome et 289 cas de CP collectés prospectivement de deux centres hospitaliers canadiens (Montréal et Toronto) avec séquençage ciblé pour 710 gènes reliés au cancer. Notre série contrôle consiste en 987 cas indemnes de cancer collectés de multiples projets locaux. Tous les échantillons ont été traités sur la même pipeline et les variants étaient limités aux variants exoniques et variants d'épissage. Avant de faire ce test, nous avons utilisé une analyse en composantes principales pour exclure les valeurs aberrantes. Pour augmenter la puissance de notre étude, nous avons limité notre test d'association à 449 gènes associés à la réparation de l'ADN, pour lesquels 682 variants rares (fréquence d'allèle mineur <0.5%) ont été identifiés dans 418 de ces gènes. MiST a été exécuté pour 235 gènes qui avaient >10 variants rares identifiés dans tous les cas et contrôles; de ceux-ci, 42 gènes étaient significatifs avant correction pour tests multiples (p<0,05), incluant les gènes connus de prédisposition au cancer BRCA1, BRCA2 et STK11. Après correction (p<0,00021), seulement deux gènes sont restés significatifs : RECQL et SMG1. La méthode « drop-one » a été utilisée pour déterminer les variants candidats responsables de l'association avec le CP pour les 3 gènes connus de prédisposition héréditaire et les 2 gènes candidats. Avec cette méthode, (augmentation de valeur-p>35%), nous avons pu identifier les mutations pathogènes connues dans les gènes BRCA1 et BRCA2, de même qu'une liste de variants candidats dans les 5 gènes. Comme l'association pour les gènes STK11 et RECQL était causée par des variants chez les contrôles, celles-ci ont été écartées comme un effet protecteur difficile à évaluer avec notre taille d'échantillon. En revanche, l'association pour SMG1, notre meilleur candidat (p=3.22E-7), était causée par 15 variants identifiés chez 29 cas et 1 contrôle. Pour supporter davantage SMG1 comme gène candidat de susceptibilité au cancer, des analyses de ségrégation ont été réalisées pour deux familles pour lesquelles des échantillons étaient disponibles. Chez l'une de ces familles, nous avons observé une ségrégation du variant chez trois individus avec CP. En résumé, cette dissertation démontre la faisabilité et l'utilité d'une approche d'association génétique par région pour identifier de nouveaux gènes de susceptibilité, de même que pour prioriser les variants à investiguer pour de futures analyses fonctionnelles. En utilisant ces méthodes, nous avons identifié un nouveau gène candidat de susceptibilité au CP, SMG1, qui devra être validé davantage dans d'autres cohortes et par des analyses fonctionnelles.
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame machine prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.
Distilled classifier scores by category (both heads)
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.001 | 0.003 |
| Meta-epidemiology (narrow) | 0.000 | 0.000 |
| Meta-epidemiology (broad) | 0.000 | 0.001 |
| Bibliometrics | 0.001 | 0.001 |
| Science and technology studies | 0.001 | 0.000 |
| Scholarly communication | 0.001 | 0.000 |
| Open science | 0.000 | 0.000 |
| Research integrity | 0.000 | 0.000 |
| Insufficient payload (model declined to judge) | 0.002 | 0.000 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".