MétaCan
Menu
← Back to cohort
Record W7162122798 · doi:10.82308/30319

Measurement error and non-random sampling: addressing biases when studying the association between behavioural characteristics and HIV phylogenetic cluster size

2017· dissertation· en· W7162122798 on OpenAlexaboutno aff
Nabila Parveen

Bibliographic record

Venuenot available
Typedissertation
Languageen
FieldImmunology and Microbiology
TopicHIV Research and Treatment
Canadian institutionsnot available
Fundersnot available
KeywordsHuman immunodeficiency virus (HIV)PopulationSidaSexual behavior

Abstract

fetched live from OpenAlex

L'infection par le virus d'immunodéficience humaine (VIH) est une maladie infectieuse qui a induit des pertes terribles depuis sa découverte, il y a un peu plus de trois décennies. Bien que les traitements actuels sont très efficaces et ont drastiquement réduit la mortalité, le VIH constitue un fardeau considérable pour les patients comme pour la société : la facture annuelle liée aux nouvelles infections par le VIH aux États-Unis est estimée à 36.4 milliards de dollars en 2002. Le virus a d'abord été identifié chez des hommes ayant des relations sexuelles avec d'autres hommes (HSH), et cette population continue d'être affectée par la maladie de manière disproportionnée.Montréal est l'un des principaux centres pour la recherche portant sur le VIH au Canada. En particulier, SPOT est une étude clef, qui se focalise sur les HSH. SPOT offre un dépistage rapide, gratuit et anonyme à la communauté HSH. SPOT recueille également données sociodémographiques et caractéristiques comportementales. Cette thèse est basée sur l'analyse des données de SPOT, agrémentées de données de séquençage ARN du VIH provenant de la cohorte du programme de génotypage du Québec et de la cohorte de primo-infection, qui renseignent sur les tailles des groupes phylogénétiques auxquels appartiennent les sujets séropositifs: large groupe signifie transmission rapide du VIH. Les chercheurs dans le domaine du VIH souhaitent déterminer les corrélats comportementaux de la taille du groupe phylogénétique, puisque la compréhension des déterminants de certains groupes plus grands pourrait suggérer des manières de cibler des interventions permettant de briser les chaînes de transmission. Cependant, il existe au Québec un nombre significatif de personnes qui vivent avec un VIH dont l'ARN n'a pas été séquencé: par conséquent, des erreurs de mesures se produisent lors de la définition de la taille du groupe dans SPOT. De plus, l'erreur de mesure dans la taille du groupe n'est pas de moyenne zéro, mais démontre plutôt une sous-évaluation de la taille réelle du groupe, et il n'est pas possible d'obtenir un échantillon de validation permettant de révéler la taille réelle du groupe pour certains participants de SPOT. Un défi supplémentaire rencontré avec SPOT réside dans le fait que la méthode de recrutement ne se base pas sur une technique d'échantillonnage probabiliste, et de ce fait, les résultats provenant de l'étude SPOT pourraient pâtir d'un manque de généralisabilité. Par conséquent, pour émettre une inférence statistique valide à propos des corrélats de la taille du groupe phylogénétique en se basant sur les données de SPOT, aussi bien les erreurs de mesure que la stratégie d'échantillonnage doivent être pris en considération. Dans cette thèse, je propose et valide des méthodes statistiques pour gérer ces deux problématiques. Dans mon premier manuscrit, j'étends la méthode simulation-extrapolation (SIMEX) à la mesure d'erreurs de moyenne non-zéro (MNZ), qui reproduit mieux les données de SPOT pour les sujets séropositifs. Je justifie cette extension de SIMEX par la modification du modèle de mesure d'erreurs de façon à ce que la taille du groupe observé soit toujours inférieure ou égale à la taille réelle de ce groupe. J'applique par la suite MZN-SIMEX aux participants séropositifs de SPOT pour examiner les corrélats de la taille de groupe phylogénétique. Dans le second manuscrit, et pour inclure dans l'analyse les données provenant des HSH séropositifs et séronégatifs, j'étends l'approche MZN-SIMEX aux situations où l'erreur de mesure dans une covariable d'intérêt dépend de la valeur d'une autre covariable correctement spécifiée. Finalement, dans le troisième manuscrit, j'ajuste simultanément pour la stratégie d'échantillonnage non-probabiliste dans SPOT, et pour la mesure d'erreurs dans la taille de groupe. Cette analyse suggère que la stratégie de comptabilisation pour le recrutement (ou échantillonnage) dans SPOT a un impact notable sur les résultats.

Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.

How this classification was reachedexpand

Full frame machine prediction

Teacher imitation

Not calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.

metaresearch head score (Codex)0.261
metaresearch head score (Gemma)0.556
Version: metacan-v3-hybrid-931329e0061cValidation status: machine_predicted_unvalidated
Candidate categoriesMetaresearch
Consensus categoriesnone
DomainCandidate signal: none · Consensus signal: none
Study designCandidate signal: Theoretical or conceptual · Consensus signal: none
GenreCandidate signal: Methods · Consensus signal: Methods
Teacher disagreement score0.261
Threshold uncertainty score0.911

Distilled classifier scores by category (both heads)

CategoryCodexGemma
Metaresearch0.2610.556
Meta-epidemiology (narrow)0.0010.001
Meta-epidemiology (broad)0.0020.002
Bibliometrics0.0030.006
Science and technology studies0.0030.005
Scholarly communication0.0040.003
Open science0.0040.004
Research integrity0.0030.003
Insufficient payload (model declined to judge)0.0010.000

Machine scores (provisional)

The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.

Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.

Opus teacher head0.137
GPT teacher head0.342
Teacher spread0.204 · how far apart the two teachers sit on this one work
Validation statusscore_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from it

Classification

machine, unvalidated

Machine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.

Study designTheoretical or conceptual
Domainnot available
GenreMethods

How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".

Quick stats

Citations0
Published2017
Admission routes1
Has abstractyes

Explore more

Same topicHIV Research and Treatment→French-language works237,207→