Characterizing and predicting daily within-city spatiotemporal variations in outdoor pollen across Montreal, Canada
Bibliographic record
Abstract
Contexte : Les données épidémiologiques actuelles suggèrent que l'exposition à court terme aux aéroallergènes peut avoir un impact sur la morbidité et la mortalité cardiorespiratoire. Cependant, ces résultats sont souvent basés sur des expositions calculées à partir de sites de surveillance uniques, qui ne peuvent pas tenir compte des variations des concentrations de pollen à l'intérieur d'une même ville. En outre, peu de modèles ont été conçus pour estimer les variations spatiotemporelles quotidiennes des concentrations de pollen, particulièrement à haute résolution en milieu urbain, et ces modèles sont nécessaires pour étayer les futures études épidémiologiques. Objectifs : Ce projet vise à caractériser et à prédire les variations spatio-temporelles des concentrations de pollen aérien en milieu urbain, en utilisant des données aéroallergènes quotidiennes, collectées via des sites fixes et mobiles à Montréal. En outre, cette thèse cherche à comparer différentes stratégies de modélisation, ainsi qu'à étudier les forces relatives de certaines variables prédictives sur les concentrations de pollen à l'extérieur, y compris les conditions météorologiques quotidiennes et les informations sur l'utilisation du sol. Méthodes : Le travail de terrain a été réalisé entre les mois de mai et août 2024. Les concentrations de pollen à l'extérieur ont été mesurées à l'aide d'échantillonneurs à impaction rotative, et les comptages de pollen ont été effectués par Aerobiology Research Laboratories à Ottawa (Ontario). Les données météorologiques ont été obtenues auprès d'Environnement et changement climatique Canada, et les données sur l'utilisation des terres ont été extraites à l'aide de systèmes d'information géographique. Toutes deux ont été reliées à notre base de données quotidiennes sur le pollen. La colinéarité potentielle a été étudiée entre les variables prédictives, et des modèles de régression linéaire et d'apprentissage automatique (c.-à-d. des modèles additifs généralisés, ainsi que du « extreme gradient boosting ») ont ensuite été utilisés pour prédire les variations spatio-temporelles quotidiennes des aéroallergènes extérieurs dans la ville de Montréal. La performance des modèles a été évaluée par des procédures de validation croisée triple. Les prédictions ont également été cartographiées, afin de visualiser les variations des concentrations de pollen à l'intérieur de la ville. Résultats : Au total, 74 mesures en site fixe (situées au centre-ville de Montréal sur le campus McGill) et 66 mesures en site mobile ont été collectées à travers Montréal, entre le 30 avril et le 23 août 2024. En moyenne, le nombre total de pollens (grains/m3) était légèrement plus élevé au site fixe (moyenne [écart-type] : 191,0 [347,1]) qu’aux sites mobiles (141,7 [235,3]), mais les concentrations ont varié considérablement tout au long de la période de surveillance, et d'un site à un autre. Les modèles extreme gradient boosting et les modèles additifs généralisés ont sû expliquer la majorité des variations spatio-temporelles du nombre total de pollens, selon les procédures de validation croisée (R² : 0,837 ; 0,737). Les prédicteurs les plus forts des concentrations quotidiennes de pollen comprenaient le jour de l'année, l'humidité relative moyenne, la température moyenne, la direction moyenne du vent, ainsi que la latitude. Des surfaces de prédiction ont été réalisées à l'aide des trois modèles pour le mois de mai 2024, lorsque la quantité totale de pollen dans l’air est la plus élevée. Elles illustrent la variabilité des concentrations de pollen aérien, mais présentent quelques incohérences d'un modèle à l'autre. Les cartes indiquent généralement des niveaux plus élevés dans certaines zones, telles que l'ouest de l'île, Mont-Royal et Pointe-Aux-Trembles, et des niveaux plus faibles dans les régions centrales de l'île. Conclusion : Cette thèse a démontré avec succès les avantages d'une approche d'échantillonnage « mobile » pour l'estimation des concentrations quotidiennes de pollen extérieur et met en évidence d'importantes variations spatiales dans les concentrations de pollen au sein des villes. Les modèles de prédiction créés dans le cadre de ce projet continueront d'être affinés au fur et à mesure de l'obtention de nouvelles données d'échantillonnage. En particulier, les modèles futurs se concentreront sur une liste élargie d'espèces spécifiques de pollen, ce qui n'a pas été possible dans l'étude actuelle en raison de la petite taille de l'échantillon. À l'avenir, ces stratégies de modélisation à haute résolution pourront être utilisées pour améliorer l'évaluation de l'exposition dans les études épidémiologiques portant sur les effets aigus des aéroallergènes sur la santé
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame machine prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.
Distilled classifier scores by category (both heads)
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.001 | 0.002 |
| Meta-epidemiology (narrow) | 0.001 | 0.000 |
| Meta-epidemiology (broad) | 0.000 | 0.001 |
| Bibliometrics | 0.001 | 0.002 |
| Science and technology studies | 0.001 | 0.000 |
| Scholarly communication | 0.002 | 0.000 |
| Open science | 0.001 | 0.001 |
| Research integrity | 0.000 | 0.000 |
| Insufficient payload (model declined to judge) | 0.001 | 0.000 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".