Prédiction de la mortalité toutes causes confondues à 5 ans chez les patients atteints de la MPOC à partir de données médico-administratives
Bibliographic record
Abstract
La maladie pulmonaire obstructive chronique (MPOC) est un fardeau de santé publique majeur, associée à une forte mortalité et à une utilisation importante des services de santé. Un modèle de prédiction intégré aux dossiers médicaux électroniques (DME) pourrait aider les cliniciens à mieux cibler les patients atteints de MPOC les plus à risque de mortalité à moyen terme. Les modèles existants reposent sur des mesures qui ne sont pas toujours disponibles dans les DME. Dans cette perspective, l’objectif principal était de développer un modèle de prédiction du risque de mortalité toutes causes confondues à 5 ans chez les patients atteints de MPOC en ambulatoire à partir de données médico-administratives accessibles dans les DME. Les objectifs secondaires étaient d’évaluer si l'ajout de variables reliées aux médicaments améliore la performance prédictive des modèles et de comparer la performance de la régression logistique à deux méthodes d’apprentissage automatique : Elastic-Net et XGBoost. En utilisant la base de données ACPI, regroupant des patients atteints d’asthme et/ou de MPOC couverts par le régime public d’assurance médicaments au Québec, une cohorte rétrospective de 179 168 patients MPOC a été constituée. Les prédicteurs incluaient des variables sociodémographiques, l’utilisation des services de santé pour la MPOC, les diagnostics et les variables reliées aux médicaments. Les résultats ont montré que l’ajout des variables reliées aux médicaments n’a entraîné qu’une amélioration modeste de la performance prédictive (AUC = 0,791-0,794 sans médicaments vs. 0,806- 0,808 avec médicaments ; Score de Brier = 1434-1443 vs. 1396-1401). Les performances étaient également comparables entre la régression logistique, Elastic-Net et XGBoost. Bien que XGBoost ait présenté le meilleur équilibre entre performance et interprétation clinique des prédicteurs les plus influents, l’écart de performance avec la régression logistique et l’Elastic-Net demeure négligeable. Cette étude démontre la faisabilité de modèles robustes à partir de données médico-administratives. Leur performance prédictive est comparable à plusieurs modèles de prédictions existants développés sur des populations similaires et souligne leur potentiel à être intégrés dans les DME pour soutenir l’identification des patients MPOC à haut risque de mortalité à moyen terme.
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame machine prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.
Distilled classifier scores by category (both heads)
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.004 | 0.012 |
| Meta-epidemiology (narrow) | 0.001 | 0.000 |
| Meta-epidemiology (broad) | 0.001 | 0.002 |
| Bibliometrics | 0.002 | 0.001 |
| Science and technology studies | 0.000 | 0.000 |
| Scholarly communication | 0.002 | 0.001 |
| Open science | 0.001 | 0.001 |
| Research integrity | 0.001 | 0.002 |
| Insufficient payload (model declined to judge) | 0.003 | 0.001 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".