Approches statistiques avancées pour la modélisation des séries chronologiques en régression, appliquées à l’épidémiologie environnementale.
Bibliographic record
Abstract
La santé des populations est un des défis majeurs liés à l’adaptation aux changements climatiques. L’effet des vagues de chaleur est notamment déjà visible alors que ces évènements devraient se multiplier dans les années à venir. Les maladies cardiovasculaires représentent une des classes de maladies les plus touchées, tout en étant déjà un problème majeur de santé publique à l’heure actuelle. De plus en plus d’études en épidémiologie environnementale visent à identifier l’effet de la météorologie sur la santé, afin d’anticiper les changements climatiques et mettre en place des alertes appropriées. Les études d’épidémiologie environnementales s’appuient notamment sur des modèles de régression, lesquels sont appliqués avec des données pouvant prendre la forme de séries chronologiques (on peut aussi citer les données de type spatial). Les séries chronologiques violent notamment les hypothèses d’indépendance et de distribution identique des résidus dans la régression, et nécessitent donc des méthodes mieux adaptées. Cette thèse propose donc des méthodologies statistiques visant à répondre aux problèmes créés par l’utilisation de séries chronologiques dans la régression. Les méthodologies consistent toutes en un prétraitement des données puis à l’application de modèles de régression adaptés pour prendre en compte les caractéristiques des données transformées. Elles sont ensuite appliquées à l’étude du lien existant entre la météorologie, en particulier la température et l’humidité, sur la mortalité par maladie cardiovasculaire dans la communauté métropolitaine de Montréal. \nLes données sanitaires utilisées dépendent notamment de l’organisation des services médicaux. Or, cette organisation entraîne la présence de bruit dans les données (p. ex. davantage de personnel de jour que de nuit), pouvant rendre plus difficile l’estimation de la relation entre une variable explicative et une réponse. Il est ainsi proposé d’agréger temporellement les séries de données sanitaires afin de faire ressortir le signal dû à la météorologie, puis d’appliquer un modèle de régression pour série temporelle visant à modéliser la dépendance temporelle dans les résidus. La comparaison de cette méthodologie avec un modèle classique d’épidémiologie environnementale montre qu’elle permet un meilleur ajustement du modèle aux données. La comparaison de diverses stratégies d’agrégation mène cependant à la conclusion que la fenêtre d’agrégation ne doit pas être supérieure à une semaine. \nUne problématique plus générale des études concernant des processus naturels est la présence de saisonnalité et tendance entre autres menant à des cas de régression fallacieuse. Il est ainsi proposé dans la thèse de décomposer les différents motifs réguliers présents dans les séries de données par décomposition modale empirique. Les composantes en résultant sont ensuite utilisées dans la régression au lieu des séries de données d’origine, en utilisant la technique du Lasso (opérateur de sélection et réduction par moindres valeurs absolues) pour ne conserver que les composantes les plus importantes pour l’explication de la réponse. L’application de cette méthodologie aux données de mortalité, température et humidité permet de mettre en évidence des aspects de la relation habituellement invisibles dans les modèles statistiques. Cette méthodologie permet ainsi un regard alternatif et détaillé sur la relation entre des séries de données chronologiques. \nDe nombreux problèmes liés à l’utilisation de séries chronologiques dans la régression tels que l’autocorrélation et la non-stationnarité sont issus du fait qu’elles sont en fait des discrétisations de processus intrinsèquement continus. La thèse propose donc de considérer les séries sanitaires et météorologiques comme des courbes continues en utilisant le cadre de l’analyse de données fonctionnelle. Notamment, les modèles de régression fonctionnelle sont adaptés aux problématiques inhérentes au domaine de l’épidémiologie environnementale. Les résultats montrent le potentiel de la régression fonctionnelle pour comprendre le lien entre la météorologie et la santé dans sa globalité, en retranscrivant notamment les processus d’adaptation physiologique des individus. In the context of climate change adaptation, public health management is a major challenge. For instance, the frequency and strength of heatwaves are expected to increase in the future while their effect on mortality is already well-known. Among the affected disease classes are cardiovascular diseases, which are already an important public health issue. Nowadays, many environmental epidemiology studies seek to understand precisely the effect of weather on population health, in order to accurately anticipate the future. Studies of the effect of meteorological factors on health often rely on regression models applied on time series data (although other types of data exist such as spatial data). However, several assumptions of regression models do not hold in presence of time series data, i.e. the assumptions of independence and same distribution of the residuals. Therefore, the purpose of the present thesis is to propose a number of regression methodologies addressing several issues caused by the temporal structure of data. The methodologies all rely on data preprocessing, in order to obtain transformed data that could be used in existing and efficient regression methods. They are illustrated on the relationship between weather and cardiovascular mortality in the census metropolitan area of Montréal, Canada. \nHealth data are often noisy because of organisational factors in hospitals, which complicate the task of estimating the effect of a weather exposure on a health issue. It is herein proposed to temporally aggregate the health response before using it in a regression model. A time series regression model is then used to account for the temporal dependence of data. Comparing this methodology with classical regression models show that it leads to a better fit to health data as well as unveiling the relationship at a the weekly scale than classical regression. Moreover, several aggregation strategies are tried and it is shown that the best results are obtained using aggregations with small time windows. \nMany natural time series contains nonstationary patterns such as seasonality and trend, which could lead to spurious regression. The present thesis proposes to decompose time series data into basic oscillating components through empirical mode decomposition in order to use the components as new variables in a regression model. The use of the Lasso (least absolute shrinkage and selection operator) allows keeping only the most important components in order to explain the health response. The application of this methodology on temperature and humidity related to cardiovascular morbidity unveils little known aspects of the relationship, in addition to providing a good fit of the data. Hence, it is argued that this methodology represents a tool to understand more accurately than classical models any relationship between time-related processes. \nMany time series related issues in regression models are due to the fact that time series can be viewed as the discretization of intrinsically continuous processes. Therefore, the present thesis argues for the use functional data analysis which deals with data as continuous curves instead of discrete series. In particular, functional regression models are adapted to the particular issues of environmental epidemiology. The application of such models on the temperature-related cardiovascular mortality shows that they are able to describe an overall relationship. Functional models especially bring a tool that allows representing the physiological adaptation of populations, rarely taken into account in classical models.
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame machine prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.
Distilled classifier scores by category (both heads)
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.016 | 0.053 |
| Meta-epidemiology (narrow) | 0.002 | 0.001 |
| Meta-epidemiology (broad) | 0.002 | 0.004 |
| Bibliometrics | 0.002 | 0.003 |
| Science and technology studies | 0.001 | 0.001 |
| Scholarly communication | 0.003 | 0.002 |
| Open science | 0.003 | 0.002 |
| Research integrity | 0.002 | 0.006 |
| Insufficient payload (model declined to judge) | 0.005 | 0.002 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".