An investigation of disease transmission clusters with Bayesian phylogenetic clustering methods
Notice bibliographique
Résumé
Plusieurs études se sont penchées sur les grappes de transmission au sein de l’épidemie de VIH-1 parmi les hommes ayant des relations sexuelles avec d’autres hommes (HARSAH) au Québec, mettant en lumière la contribution de ces grappes à l’incidence. Les études de ce type se fient habituellement à un échantillon de séquences génétiques de VIH-1, dont l’histoire ancestrale est inférée grâce à un modèle phylogénétique, produisant un arbre utilisé pour partitionner l’échantillon. La compréhension des grappes trouvées par l’intermédiaire d’une analyse phylogénétique est toutefois limitée, ce qui se traduit par une multitude de critères arbitraires pour leur estimation. La thèse, comportant trois articles, cherche à augmenter la compréhension des grappes phylogénétiques, à proposer des améliorations aux méthodes actuelles d’inférence des grappes de transmission, et à fournir une mise à jour des estimés des grappes de transmission du VIH-1 au Québec.Le premier article de la thèse traite de l’interprétation des grappes phylogénétiques. À l’aide de simulations d’épidémies sur plusieurs catégories de réseaux de contacts, nous explorons l’association entre les grappes phylogénétiques, obtenues par l’application de différentes méthodes de regroupement basées sur la distance, et les communautés, des groupes distinctifs d’individus dans le réseau. Nous remarquons une correspondance limitée entre les grappes et les communautés, et concluons qu’une interprétation des grappes phylogénétiques en termes de la structure du réseau de contacts pourrait être difficile à justifier.Le deuxième article présente un nouvel algorithme de regroupement phylogénétique, DM-PhyClus, qui mêle à l’inférence des grappes une définition claire des grappes de transmission, donnant ainsi une interprétation sans ambiguïté aux grappes inférées. Contrairement aux approches conventionnelles de regroupement, DM-PhyClus ne nécessite pas l’application à la phylogénie inférée de critères arbitraires de distance génétique ou de confiance en les clades obtenues. Les simulations révèlent que DM-PhyClus peut battre les méthodes conventionnelles sur le plan du taux moyen de détection des grappes. Nous appliquons la méthode à un échantillon de séquences véritables de VIH-1 tirées de la base de données du programmequébécois de génotypage du VIH, ce qui révèle un ensemble de grappes très similaires à celles proposées par une étude précédente dont les estimés ont été partiellement validés.Le troisième article inclut une analyse détaillée de regroupement des cas de VIH-1 parmi des HARSAH basée sur les séquences d’ADN collectées dans le cadre du programme québécois de génotypage du VIH. Tout d’abord, nous regroupons les données à l’aide de deux méthodes conventionnelles: l’inférence phylogénétique par maximum de vraisemblance, cou-plée avec l’estimation de la confiance en les clades par le bootstrap, et l’estimation phylogénétique bayésienne pure. Nous partitionnons par la suite l’échantillon à l’aide de DM-PhyClus et du Gap Procedure, deux approches cherchant à éviter la sélection arbitraire de critères de regroupement. Les analyses basées sur les méthodes conventionnelles produisent des estimés de grappes très similaires, tandis que DM-PhyClus et le Gap Procedure proposent des partitions modérément distinctives. Un coup d’oeil aux cas diagnostiqués récemment, et dont la date d’infection se situe au maximum six mois auparavant, met en lumière une expansion considérable des plus grandes grappes de transmission et l’émergence potentielle de quelques nouvelles grappes. Les résultats de l’étude soulignent le rôle persistant des grappes de transmission dans la survie de l’épidémie de VIH parmi les HARSAH. De plus, ils suggèrent que les événements de transmission hâtifs expliqueraient pourquoi les améliorations aux traitements antirétroviraux n’ont pas mené à une résorption de l’épidémie.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction machine sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.
Scores du classifieur distillé par catégorie (deux têtes)
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,013 | 0,043 |
| Méta-épidémiologie (sens strict) | 0,001 | 0,001 |
| Méta-épidémiologie (sens large) | 0,001 | 0,002 |
| Bibliométrie | 0,005 | 0,004 |
| Études des sciences et des technologies | 0,002 | 0,001 |
| Communication savante | 0,003 | 0,002 |
| Science ouverte | 0,003 | 0,002 |
| Intégrité de la recherche | 0,002 | 0,002 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,003 | 0,001 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».