Développement d’une méthode télé-épidémiologique et macroécologique pour la prédiction de pathogènes potentiels dans les lacs canadiens à l’aide de données géospatiales et bio-optiques
Bibliographic record
Abstract
Les maladies infectieuses font partie des causes de mortalité et de morbidité les plus importantes au monde avec en moyenne chaque année 9.6 millions de décès humains. Il existe une très grande diversité de pathogènes responsables de ces maladies qui peuvent être naturellement présents dans l’environnement ou être issus de sources de contaminations spécifiques ponctuelles (PS ou Point Sources; p. ex.: contamination fécale directe d’excréments d’animaux ou d’humains, fuites d’eau usée) ou diffuses (NPS ou Non-Point Sources; p. ex.: épandage agricole, eaux résiduelles urbaines). Les pathogènes peuvent aussi circuler entre les différents hôtes (c.à.d.: humains, animaux, végétaux) et vecteurs (p. ex.: rongeurs, moustiques, tiques) qu’ils contaminent. Ainsi jusqu’à 60.3% des maladies infectieuses émergeantes chez l’Humain seraient d’origine animale. Pour limiter l’impact des maladies sur les populations, des connaissances sur la distribution géographique des pathogènes et leurs niches écologiques sont nécessaires. En effet, endiguer de futures éclosions de maladies est un des défis de la science actuelle pour soutenir la santé publique, la sécurité alimentaire et la conservation des espèces. Actuellement, seulement 4% des 355 pathogènes infectieux les plus importants pour l’Humain ont été cartographiés à l’échelle mondiale. Par ailleurs, les changements environnementaux et climatiques ont des conséquences sur l’occurrence des maladies en altérant les niches écologiques des pathogènes, de leurs hôtes et de leurs vecteurs. En ce sens, les connaissances déjà établies pourraient, à l’avenir, devenir obsolètes sans le développement de modèles prédictifs fiables. Dans ce projet, une approche télé-épidémiologique et macroécologique a été utilisée pour développer des modèles prédictifs sur différents types de pathogènes potentiels échantillonnés dans des lacs canadiens. Cette approche se base sur l’idée que les lacs sont des sentinelles des changements environnementaux qui se produisent dans leurs bassins versants. Ils pourraient ainsi capturer à la fois des micro-organismes naturellement présents dans l’environnement, mais aussi des micro-organismes issus de sources localisées dans les bassins versants. La méthode pluridisciplinaire développée dans ce projet, implique l’utilisation de données de micro-organismes issues de séquences ADN et de propriétés bio-optiques de constituants collectés dans environ 660 lacs canadiens ainsi que des données géospatiales et de télédétection publique. L’ensemble des données ont ensuite été utilisé dans un modèle d’arbre de régression boosté avec ensachage. De manière générale, les résultats montrent des liens entre des microchampignons, parasites et bactéries potentiellement pathogéniques retrouvés dans les lacs et des facteurs environnementaux de contamination. Pour les microchampignons et les parasites, les résultats ont montré que les facteurs les plus importants sont les constituants bio-optiques de l’eau qui pourraient agir comme bouclier face aux ultraviolets ou fournir une source de nutriments pour les pathogènes. Pour les bactéries, les espèces les plus abondantes et les plus présentes trouvées dans les lacs, ont formé un groupe distinct de micro-organismes reliés au facteur climatique de la température de l’air. A l’inverse les bactéries les moins abondantes et les moins présentes ont été davantage reliées à des NPS issus d’activités agricoles et/ou d’élevage. En utilisant un multi-indicateur bactérien de contamination anthropique et fécale (c.à.d.: formé à partir de plusieurs pathogènes), des prédictions ont été établies sur 200 212 lacs à travers les écozones du Sud du Canada et ont montré une abondance plus élevée dans l’écozone des Prairies que dans le reste du Canada. De manière générale, ce travail montre qu’une approche télé-épidémiologique peut offrir des connaissances et des ressources cartographiques intéressantes pour la santé publique, la sécurité alimentaire et la conservation des espèces.
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame machine prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.
Distilled classifier scores by category (both heads)
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.004 | 0.008 |
| Meta-epidemiology (narrow) | 0.002 | 0.001 |
| Meta-epidemiology (broad) | 0.002 | 0.002 |
| Bibliometrics | 0.003 | 0.002 |
| Science and technology studies | 0.001 | 0.001 |
| Scholarly communication | 0.003 | 0.002 |
| Open science | 0.001 | 0.001 |
| Research integrity | 0.002 | 0.001 |
| Insufficient payload (model declined to judge) | 0.005 | 0.003 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".