Measuring and estimating the effect of copy number variants on autism spectrum disorder and early-onset psychosis risk
Bibliographic record
Abstract
Les variations du nombre de copies (i.e., VNC, perte ou gain de matériel génétique de plus de 1 kilobase) figurent parmi les facteurs biologiques les plus associés aux troubles neurodéveloppementaux (TNDs), tels que les troubles du spectre autistique (TSAs) ou la psychose précoce. Les variants génétiques classés comme pathogéniques sont identifiés chez environ 20% des enfants avec des symptômes de TSA référés en génétique clinique. Actuellement, seules les VNCs les plus récurrentes (i.e., plusieurs individus non apparentés ont le même variant) ont été associées avec les TSAs et leurs tailles d’effets ont pu être décrites avec précision grâce à des études d'associations (i.e., cas-contrôles). Cependant, la plupart des VNCs identifiées dans les cliniques neurodéveloppementales et génétiques sont ultra-rares. À ma connaissance, aucune méthode n’a été développée afin d’estimer et de prédire de façon précise la contribution de tels variants aux phénotypes cliniques. De ce fait, l’impact de ces variants ultra-rares sur les risques d'avoir des TNDs, comme les TSAs ou la psychose précoce, reste incertain. Une étude récente de mon groupe de recherche a démontré que les tailles d'effet des délétions et duplications à travers le génome sur les capacités cognitives pouvaient être prédites statistiquement avec 78% de précision en utilisant des mesures d'intolérance à la perte de fonction. Le but de cette thèse est de développer des modèles similaires pour définir les tailles d'effet des VNCs à travers le génome sur les risques de TSA et de psychose précoce, ainsi que sur quelques traits cognitifs et comportementaux affectés dans ces troubles. J’ai analysé tous les VNCs ≥ 50 kilobases identifiées via les données de puces de génotypage et de séquençage sur génome entier chez 137 enfants et adolescents avec une psychose précoce (Boston Children’s hospital), 5,540 probands avec des TSAs (Simons Simplex Collection et MSSNG), et 17,471 personnes de la population générale (Lothian birth cohort, Generation Scotland, IMAGEN et Saguenay Youth Study). Les gènes codants totalement compris dans les VNCs ont été annotés avec neufs variables quantitatives, incluant le score d’intolérance à la perte de fonction et d’autres scores fonctionnels et génétiques. Des modèles statistiques incluant ces scores ont été testés afin de sélectionner celui qui explique le mieux l’effet des VNCs à travers le génome sur le risque de TSA et le quotient intellectuel (QI). Le meilleur modèle a été utilisé par la suite pour investiguer les tailles d’effets des VNCs sur d’autres traits cognitifs et comportementaux liés aux TSAs, ainsi que sur le risque de psychose précoce. Le score d’intolérance à la perte de fonction expliquait le mieux les effets des VNCs sur le risque de TSA et la cognition générale. Les modèles incluant ces scores ont démontré que les délétions et les duplications augmentaient les risques de psychose précoce et de TSA, même après ajustement pour le QI. Il n’y avait aucune différence de tailles d’effets des VNCs entre la psychose précoce et le TSA. La fréquence de loci associé précédemment avec des TNDs et des troubles neuropsychiatriques était également similaire entre dans les TSA et la psychose précoce, et le modèle estimait précisément la taille d'effet de la plupart de ces loci sur le risque de TSA en comparaison aux observation empiriques publiées précédemment. Les CNVs à travers le génome mesurés par le score d’intolérance à la perte de fonction diminuaient de façon similaire le QI dans les populations TSA et générale. Les effets des duplications étaient systématiquement plus faibles que les effets des délétions pour chacun de ces phénotypes, ce qui suggère un effet plus pathogénique des délétions. Les délétions et les duplications affectaient différentiellement la communication sociale, les comportements, et la mémoire phonologique, tandis qu'elles affectaient similairement les capacités motrices dans les populations TSA. L'enrichissement similaire des VNCs à travers le génome dans la psychose précoce et le TSA suggère un effet pléiotropique des VNCs dans ces différentes symptomatologies. Le dépistage routinier pour les VNCs doit être accessible dans les soins cliniques standards des jeunes avec une psychose précoce, comme il est recommandé pour les TSAs. Une telle pratique contribue à établir une médecine personnalisée et peut apporter des bénéfices médicaux comme la détection de comorbidités, la prédiction de la progression de la maladie, et faciliter la communication avec les parents à propos de la nature biologique du trouble. Les modèles appliqués dans ce projet, entraînés sur des VNCs incluant plus de 4,500 gènes, suggèrent des propriétés hautement polygéniques du dosage génique dans les TNDs. J’ai estimé que chaque VNC de 1 mégabase, incluant au moins un gène scorant pour l’intolérance à la perte de fonction, augmente le risque de TSA. La combinaison de ces résultats ouvre de nouvelles perspectives dans la compréhension des effets des VNCs à travers le génome sur les TNDs et les traits associés (e.g., QI ou symptômes comportementaux). Ces modèles ont été implémentés dans un outil en ligne qui a pour but d'aider les cliniciens à estimer les tailles d’effet des VNCs identifiés en clinique et à interpréter leur contribution au phénotype du patient.
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame machine prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.
Distilled classifier scores by category (both heads)
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.009 | 0.038 |
| Meta-epidemiology (narrow) | 0.001 | 0.001 |
| Meta-epidemiology (broad) | 0.001 | 0.003 |
| Bibliometrics | 0.002 | 0.002 |
| Science and technology studies | 0.000 | 0.001 |
| Scholarly communication | 0.001 | 0.001 |
| Open science | 0.001 | 0.001 |
| Research integrity | 0.001 | 0.001 |
| Insufficient payload (model declined to judge) | 0.003 | 0.001 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".