Machine Learning for Disease Outbreak Detection Using Probabilistic Models
Bibliographic record
Abstract
L'expansion de maladies connues et l'mergence de nouvelles maladies ont affect la vie de nombreuses personnes et ont eu des consquences conomiques importantes.L'bola n'est que le dernier des exemples rcents.La dtection prcoce d'infections pidmiologiques s'avre donc un enjeu de taille.Dans le secteur de la surveillance syndromique, nous avons assist rcemment une prolifration d'algorithmes de dtection d'pidmies.Leur performance peut varier entre eux et selon diffrents paramtres de configuration, de sorte que l'efficacit d'un systme de surveillance pidmiologique s'en trouve d'autant affect.Pourtant, on ne possde que peu d'valuations fiables de la performance de ces algorithmes sous diffrentes conditions et pour diffrents types d'pidmie.Les valuations existantes sont bases sur des cas uniques et les donnes ne sont pas du domaine public.Il est donc difficile de comparer ces algorithmes entre eux et difficile de juger de la gnralisation des rsultats.Par consquent, nous ne sommes pas en mesure de dterminer quel d'algorithme devrait tre appliqu dans quelles circonstances.Cette thse poursuit trois objectifs gnraux : (1) tablir la relation entre la performance des algorithmes de dtection d'pidmies et le type et la svrit de ces pidmies, (2) amliorer les prdictions d'pidmies par la combinaison d'algorithmes et (3) fournir une mthode d'analyse des pidmies qui englobe une perspective de cots afin de minimiser l'impact conomique des erreurs du type faux positifs et faux ngatifs.L'approche gnrale de notre tude repose sur l'utilisation de donnes de simulation d'pidmies dont le vecteur de transmission est un rseau d'aqueducs.Les donnes sont obtenues de la plateforme de simulation SnAP du Department of Epidemiology and Biostatistics Surveillance Lab de l'universit McGill.Cette approche nous permet de crer les diffrentes conditions de types et d'intensits d'pidmiologie ncessaires l'analyse de la performance des algorithmes de dtection.Le premier objectif porte sur l'influence des diffrents types et diffrentes intensits d'pidmiologie sur la performance des algorithmes.Elle est modlise l'aide d'un modle bas sur un rseau baysien.Ce modle prdit avec succs la variation de performance observe dans les donnes.De plus, l'utilisation d'un rseau baysien permet de quantifier l'influence de chaque variable et relve aussi le rle que jouent d'autres paramtres qui taient jusqu'ici ignors dans les travaux antrieurs, savoir le seuil de dtection et l'importance de tenir compte de rcurrences hebdomadaires.vi Le second objectif vise exploiter les rsultats autour du premier objectif et de combiner les algorithmes pour optimiser la performance en fonction des facteurs d'influence.Les rsultats des algorithmes sont combins l'aide de la mthode de Mixture hirarchique d'expert (Hierarchical Mixture of Experts-HME).Le modle HME est entran pondrer la contribution de chaque algorithme en fonction des donnes.Les rsultats de cette combinaison des rsultats d'algorithmes sont comparables avec les meilleurs rsultats des algorithmes individuels, et s'avrent plus robustes travers diffrentes variations.Le niveau de contamination n'influence pas la performance relative du modle HME.
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame distilled prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. Learned from the 10,348 direct Codex labels and 10,348 direct Gemma labels. Candidate is the union of thresholded teacher heads; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels or direct frontier model labels.
Codex and Gemma teacher scores by category
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.000 | 0.001 |
| Meta-epidemiology (narrow) | 0.001 | 0.001 |
| Meta-epidemiology (broad) | 0.001 | 0.001 |
| Bibliometrics | 0.001 | 0.000 |
| Science and technology studies | 0.001 | 0.000 |
| Scholarly communication | 0.000 | 0.000 |
| Open science | 0.001 | 0.000 |
| Research integrity | 0.001 | 0.001 |
| Insufficient payload (model declined to judge) | 0.000 | 0.000 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one teacher head, not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".