Measurement error and non-random sampling: addressing biases when studying the association between behavioural characteristics and HIV phylogenetic cluster size
Bibliographic record
Abstract
L'infection par le virus d'immunodéficience humaine (VIH) est une maladie infectieuse qui a induit des pertes terribles depuis sa découverte, il y a un peu plus de trois décennies. Bien que les traitements actuels sont très efficaces et ont drastiquement réduit la mortalité, le VIH constitue un fardeau considérable pour les patients comme pour la société : la facture annuelle liée aux nouvelles infections par le VIH aux États-Unis est estimée à 36.4 milliards de dollars en 2002. Le virus a d'abord été identifié chez des hommes ayant des relations sexuelles avec d'autres hommes (HSH), et cette population continue d'être affectée par la maladie de manière disproportionnée.Montréal est l'un des principaux centres pour la recherche portant sur le VIH au Canada. En particulier, SPOT est une étude clef, qui se focalise sur les HSH. SPOT offre un dépistage rapide, gratuit et anonyme à la communauté HSH. SPOT recueille également données sociodémographiques et caractéristiques comportementales. Cette thèse est basée sur l'analyse des données de SPOT, agrémentées de données de séquençage ARN du VIH provenant de la cohorte du programme de génotypage du Québec et de la cohorte de primo-infection, qui renseignent sur les tailles des groupes phylogénétiques auxquels appartiennent les sujets séropositifs: large groupe signifie transmission rapide du VIH. Les chercheurs dans le domaine du VIH souhaitent déterminer les corrélats comportementaux de la taille du groupe phylogénétique, puisque la compréhension des déterminants de certains groupes plus grands pourrait suggérer des manières de cibler des interventions permettant de briser les chaînes de transmission. Cependant, il existe au Québec un nombre significatif de personnes qui vivent avec un VIH dont l'ARN n'a pas été séquencé: par conséquent, des erreurs de mesures se produisent lors de la définition de la taille du groupe dans SPOT. De plus, l'erreur de mesure dans la taille du groupe n'est pas de moyenne zéro, mais démontre plutôt une sous-évaluation de la taille réelle du groupe, et il n'est pas possible d'obtenir un échantillon de validation permettant de révéler la taille réelle du groupe pour certains participants de SPOT. Un défi supplémentaire rencontré avec SPOT réside dans le fait que la méthode de recrutement ne se base pas sur une technique d'échantillonnage probabiliste, et de ce fait, les résultats provenant de l'étude SPOT pourraient pâtir d'un manque de généralisabilité. Par conséquent, pour émettre une inférence statistique valide à propos des corrélats de la taille du groupe phylogénétique en se basant sur les données de SPOT, aussi bien les erreurs de mesure que la stratégie d'échantillonnage doivent être pris en considération. Dans cette thèse, je propose et valide des méthodes statistiques pour gérer ces deux problématiques. Dans mon premier manuscrit, j'étends la méthode simulation-extrapolation (SIMEX) à la mesure d'erreurs de moyenne non-zéro (MNZ), qui reproduit mieux les données de SPOT pour les sujets séropositifs. Je justifie cette extension de SIMEX par la modification du modèle de mesure d'erreurs de façon à ce que la taille du groupe observé soit toujours inférieure ou égale à la taille réelle de ce groupe. J'applique par la suite MZN-SIMEX aux participants séropositifs de SPOT pour examiner les corrélats de la taille de groupe phylogénétique. Dans le second manuscrit, et pour inclure dans l'analyse les données provenant des HSH séropositifs et séronégatifs, j'étends l'approche MZN-SIMEX aux situations où l'erreur de mesure dans une covariable d'intérêt dépend de la valeur d'une autre covariable correctement spécifiée. Finalement, dans le troisième manuscrit, j'ajuste simultanément pour la stratégie d'échantillonnage non-probabiliste dans SPOT, et pour la mesure d'erreurs dans la taille de groupe. Cette analyse suggère que la stratégie de comptabilisation pour le recrutement (ou échantillonnage) dans SPOT a un impact notable sur les résultats.
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame machine prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.
Distilled classifier scores by category (both heads)
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.261 | 0.556 |
| Meta-epidemiology (narrow) | 0.001 | 0.001 |
| Meta-epidemiology (broad) | 0.002 | 0.002 |
| Bibliometrics | 0.003 | 0.006 |
| Science and technology studies | 0.003 | 0.005 |
| Scholarly communication | 0.004 | 0.003 |
| Open science | 0.004 | 0.004 |
| Research integrity | 0.003 | 0.003 |
| Insufficient payload (model declined to judge) | 0.001 | 0.000 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".