To impute or exclude, what’s the impact?
Notice bibliographique
Résumé
TPS 691: Methods of measurement, design and data analysis, Exhibition Hall, Ground floor, August 28, 2019, 3:00 PM - 4:30 PM Background: Missing data is persistently a thorn in the side of data science researchers. While there are various ways to deal with missing data, from basic to sophisticated, it is critical to understand the pattern and characteristics of your missing data (i.e. is it missing (completely) at random?). Most importantly, how does the missing impact the dependent variable? Aim: The purpose of this work is to assess the pattern of missing person-year data, particularly for the years leading up to the censoring event (e.g. death), and to examine the impact of excluding or imputing on survival model risk estimates. Methods: We use the 2001 Canadian Census Health and Environment Cohort (CanCHEC, N=3.1 million, 16-years follow-up). Residential postal codes reported on annual income tax filings were used to account for residential mobility among respondents and for exposure and area-based covariate assignment. Missing postal codes were assessed by proximity in years to censoring event (non-accidental mortality) and relationship to other covariates (education, income, etc.). Imputation took three forms, national annual mean, person-year mean, truncated postal code mean. We use Cox survival models to estimate hazard ratios of fine particulate matter (PM2.5) to assess the impact of exclusion versus imputation. Results: Four percent of person-years were missing postal codes, with slightly higher proportions in the years leading up to a mortality event. Imputation method had little impact on the overall PM2.5 mean (7.03 vs. 7.04 μg/m3); however, levels of PM2.5 were notably larger among subjects who died and were missing data compared to survivors (7.57 vs. 7.04 μg/m3) and tended to have lower socioeconomic characteristics. Preliminary results suggest that excluding person-years with the demonstrated pattern of missing can have large nullifying impact on the PM2.5 hazard ratio. Conclusion: Missing data can impact results. Discussion will focus on sensitivity tests to examine missing data.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction distillée sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Apprise à partir de 10 348 étiquettes directes de Codex et de 10 348 étiquettes directes de Gemma. Le mode candidate est l'union des têtes enseignantes seuillées; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont ni des étiquettes humaines ni des étiquettes directes de modèles de pointe.
Scores Codex et Gemma par catégorie
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,003 | 0,000 |
| Méta-épidémiologie (sens strict) | 0,000 | 0,000 |
| Méta-épidémiologie (sens large) | 0,001 | 0,000 |
| Bibliométrie | 0,000 | 0,000 |
| Études des sciences et des technologies | 0,000 | 0,001 |
| Communication savante | 0,000 | 0,001 |
| Science ouverte | 0,001 | 0,001 |
| Intégrité de la recherche | 0,000 | 0,001 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,041 | 0,049 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; les deux têtes enseignantes s’accordent sur ce qui est montré ici.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».