Conception d'algorithmes probabilistes pour l'estimation des génotypes d'un corpus de généalogie par chaînes de Markov
Notice bibliographique
Résumé
La fréquence d'un trait génétique dans une population contemporaine dépend de la fréquence de ce trait chez les ancêtres. Cependant, la seule information génotypique disponible sur ces ancêtres est essentiellement constituée des analyses d'ADN sur un échantillon de contemporains. Aussi, l'intégration des données moléculaires et des données généalogiques se heurtent naturellement à un problème de complétude. L'un des principaux problèmes en génétique des populations est alors d'inférer sur les génotypes de ces ancêtres en se basant sur un échantillon d'individus contemporains. On ne peut cependant reproduire de façon exacte les génotypes des individus. En effet, les lois de transmission des gènes sont telles qu'il est rarement possible d'obtenir un génotype certain pour un ancêtre ; au mieux il est possible d'obtenir qu'une estimation de la loi de probabilité des génotypes ancestraux. L'utilisation d'algorithmes déterministes permet dans des cas simples de trouver les solutions à ce problème. Néanmoins, certains algorithmes probabilistes, particulièrement les méthodes de Monte Carlo par Chaînes de Markov (MCMC), sont particulièrement adaptés à l'analyse des génotypes liée à une structure généalogique. Elizabeth A. Thompson utilise cette technique pour effectuer des analyses de liaisons génétiques (linkage) sur des noyaux familiaux étendus (Wijsman et al. [28]). Le contexte général d'un algorithme probabiliste en informa11 tique étant l'utilisation d'un générateur de nombres pseudo aléatoires, la mise en place de tels algorithmes est donc relativement facile et s'adapte très bien à des problèmes d'inférence. Notre objectif est alors de concevoir des algorithmes efficaces pour l'estimation des génotypes d'un corpus de généalogie en utilisant la technique des MCMC. Le caractère théorique de ces algorithmes et leur efficacité ont été largement étudiés dans plusieurs ouvrages sur lesquelles nous nous sommes basés. Dans ce mémoire, nous nous appliquons principalement à utiliser les méthodes de Monte Carlo par chaînes de Markov (MCMC) à l'analyse de corpus de généalogie. Nous montrons comment nous réussissons à adapter la méthode de l'échantillonnage de Gibbs à l'élaboration d'algorithmes efficaces pour l'inférence des distributions de probabilité génotypique dans le contexte de généalogies profondes.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction machine sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.
Scores du classifieur distillé par catégorie (deux têtes)
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,009 | 0,034 |
| Méta-épidémiologie (sens strict) | 0,002 | 0,002 |
| Méta-épidémiologie (sens large) | 0,003 | 0,004 |
| Bibliométrie | 0,004 | 0,003 |
| Études des sciences et des technologies | 0,002 | 0,003 |
| Communication savante | 0,006 | 0,006 |
| Science ouverte | 0,006 | 0,003 |
| Intégrité de la recherche | 0,004 | 0,006 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,010 | 0,004 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».