A novel method to identify significant DNA motifs in the human genome associated with Alzheimer’s disease
Notice bibliographique
Résumé
Alzheimer’s disease (AD) is a complex disorder influenced by both environmental and genetic factors. Around 47 million people worldwide are living with dementia, most have AD. Genome wide association studies (GWAS) have identified 21 associated loci (Lambert et al, 2013). The proposed method is to compare the DNA sequences around the SNPs of interest (for example GWAS hits) (these regions will be referred to as Areas of Interest- AOI) with regions around matched SNPs in the rest if the genome (Areas Not of Interest- ANOI). We aim to identify motifs with significant differences in the frequency. Such motifs have the potential to help us understand the functional role of GWAS hits and identify risk variants in other studies. We are currently investigating AOI from the AD GWAS mentioned above. The most significant SNP at each locus (index SNPs) and all SNPs in high linkage disequilibrium (LD >0.8) are included. AOIs of 200bp around each SNP are defined. Index ANOI SNPs are matched to the AD index SNPs on the basis of allele frequency. We count of all possible DNA motifs (of a predetermined length) in the AOI and ANOI. Next the counts are grouped according to complementary strands matching and directional matching. Finally, statistical tests e.g. Fisher Exact test and Cochran Armitage trend test are performed. We will use this method to analyses other data such as expression quantitative trait loci data from the Genome-Tissue expression (GTex) project.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction machine sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.
Scores du classifieur distillé par catégorie (deux têtes)
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,000 | 0,002 |
| Méta-épidémiologie (sens strict) | 0,001 | 0,000 |
| Méta-épidémiologie (sens large) | 0,001 | 0,001 |
| Bibliométrie | 0,003 | 0,001 |
| Études des sciences et des technologies | 0,000 | 0,000 |
| Communication savante | 0,001 | 0,000 |
| Science ouverte | 0,001 | 0,001 |
| Intégrité de la recherche | 0,001 | 0,001 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,003 | 0,001 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».