Methodological issues in relation to the development of land use regression models and exposure surfaces of ultrafine air pollutants : exposure assessment of outdoor ultrafine particles for epidemiological risk analyses in the Montreal area
Bibliographic record
Abstract
Introduction: Les particules ultrafines (PUF) constituent la plus petite fraction de matières particulaires (MP) actuellement mesurable avec des diamètres aérodynamiques <0,1 µm. En raison de leur taille plus petite et de leur surface collective plus élevée que d’autres particules plus grossières, les PUF pourraient avoir des effets plus importants sur la santé. Objectifs: L’objectif ultime de ce projet doctoral est de développer des surfaces d’exposition aux PUF les plus valides possible pour la région de Montréal. Afin d’atteindre cet objectif ultime, nous devions répondre à trois objectifs méthodologiques intermédiaires : Premièrement, évaluer la variabilité spatiale et temporelle des PUF dans la région de Montréal. Deuxièmement, construire des modèles LUR (Land Use Regression) spécifiques à deux saisons (été, hiver) avec différentes transformations de variables et stratégies de sélection de variables. Troisièmement, dériver des surfaces d’exposition aux PUF à l’aide de prévisions de modèles LUR. Méthodes: Nous avons utilisé les données recueillies lors de campagnes de surveillance en site fixe dans la région de Montréal, où les PUF ont été mesurées en hiver (mars 2013) et en été (août-septembre 2015) sur 249 sites d’échantillonnage. Lors de chaque campagne, chacun des sites d’échantillonnage a été visité trois fois pendant trois semaines consécutives. Chaque visite d’échantillonnage comprenait une période de mesure de 20 minutes pour les PUF avec une mesure toutes les secondes. Pour le premier sous-objectif, nous avons étudié la variabilité spatiale des PUF par rapport à deux catégories géographiques différentes de sites d’échantillonnage. Nous avons étudié la variabilité temporelle des PUF à différents niveaux de temps. Pour le deuxième sous-objectif, nous avons calculé près d’une centaine de prédicteurs candidats à la construction des modèles LUR. Nous avons normalisé la distribution des prédicteurs les plus biaisés. Nous avons sélectionné les prédicteurs les plus pertinents parmi leurs variations avant de construire des modèles LUR parcimonieux spécifiques à la saison en suivant des algorithmes de sélection progressive avant et arrière. Pour le troisième sous-objectif, nous avons généré les surfaces d’exposition aux PUF correspondants aux modèles LUR basés sur la prédiction qui comprenaient trente prédicteurs (appelés « modèles complets »). Résultats et conclusions: Nous avons constaté qu’il existe une variabilité considérable des niveaux des PUF dans le temps et dans l’espace. Les niveaux de PUF en hiver étaient presque deux fois plus élevés que ceux observés en été. Les prédicteurs candidats dont la distribution est asymétrique doivent être normalisés avant la construction du modèle afin de minimiser les valeurs aberrantes des PUF qui pourraient ne pas être représentatives des PUF réelles dans la zone d’étude. Nous avons pu générer des contrastes plus fins des PUF dans les surfaces d’exposition générées à l’aide de modèles complets, qui pourraient être plus représentatifs de la distribution spatiale réelle des PUF dans la zone d’étude, par rapport aux modèles parcimonieux classiquement utilisés dans la littérature. Les surfaces d’exposition spécifiques aux saisons générées à l’aide de modèles complets pourraient contribuer à réduire les erreurs de classification non-différentielles d’exposition aux PUF dans les études épidémiologiques.
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame machine prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.
Distilled classifier scores by category (both heads)
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.046 | 0.125 |
| Meta-epidemiology (narrow) | 0.001 | 0.001 |
| Meta-epidemiology (broad) | 0.001 | 0.002 |
| Bibliometrics | 0.001 | 0.003 |
| Science and technology studies | 0.001 | 0.002 |
| Scholarly communication | 0.003 | 0.001 |
| Open science | 0.006 | 0.003 |
| Research integrity | 0.001 | 0.002 |
| Insufficient payload (model declined to judge) | 0.003 | 0.001 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".