Passifor - Proposition d'Amélioration du Système de Suivi de la biodiversité FORestière. Volet 2 : Test méthodologique comparant les diversités obtenues par identification morphologique ou métabarcoding
Notice bibliographique
Résumé
/ Les Coléoptères sont souvent employés comme indicateurs de réponse en écologie forestière appliquée, mais leur hyperdiversité rend difficile leur identification spécifique qui requiert une expertise taxonomique forte et rare. Leur identification moléculaire peut remédier à ce problème. \nLa première étape d'une approche visant à identifier des espèces de coléoptères saproxyliques en utilisant des marqueurs génétiques spécifiques consiste à construire une librairie de référence. Le marqueur génétique choisi comme code-barres ADN standard pour identifier les animaux est un fragment d'environ 650 paires de bases du gène mitochondrial codant la Cytochrome Oxydase I. En Europe, 2 librairies de codes-barres ADN pour les Coléoptères ont émergé pendant le projet Passifor, en Bavière et en Finlande, pour 4330 espèces. La bibliothèque PASSIFOR comprend les codes-barres ADN de 656 spécimens de coléoptères saproxyliques appartenant à 410 espèces, 251 genres et 40 familles (Rougerie et al., 2015), compilés dans la base de données en ligne BOLD (www.boldsystems.org - projet PSFOR). Les tissus de près d'un millier de spécimens de référence avaient été envoyés pour séquençage au Centre Canadien de barcoding ADN (CCDB) à l'Institut de la Biodiversité d'Ontario à Guelph. Le taux de succès du séquençage est satisfaisant (63%). L'analyse des séquences produites a démontré l'efficacité du marqueur choisi pour la discrimination des espèces, y compris pour des taxons phylogénétiquement proches. Plusieurs questions taxonomiques intéressantes ont été soulevées par nos résultats, et soulignent les perspectives d'intégration des codes-barres ADN dans la pratique taxonomique (taxonomie intégrative). 7 espèces présentant une forte variabilité génétique intraspécifique peuvent être composées de plusieurs espèces (diversité cryptique). Six couples et un triplet d'espèces montrent une très faible distance génétique et partagent le même barcode, ce qui questionne la validité de la ségrégation des espèces impliquées.\nLa seconde partie du projet a consisté en la mise en oeuvre d'un test méthodologique comparant l'identification des espèces par l'approche morphologique traditionnelle ou par métabarcoding. Le métabarcoding, en plein essor dans l'étude empirique de la biodiversité, consiste non plus à séquencer des individus un par un, mais à prendre des échantillons multi-spécifiques, à en extraire l'ADN global (« soupe d'ADN ») et à séquencer à haut-débit (NGS) le barcode des individus. Les atouts et les contraintes de cette technologie sont discutés. Nous avons appliqué le métabarcoding à l'analyse de relevés de piégeage de coléoptères saproxyliques. 35 échantillons représentant différentes modalités de type de piégeage, de mode de préservation des échantillons, de substrat de séquençage (matériel biologique broyé vs alcool de stockage) ont été recueillis, identifiés par un opérateur classique, reconditionnés puis traités par NGS au Centre Canadien de Barcoding ADN (CCDB) à l'Institut de la Biodiversité d'Ontario à Guelph au Canada. Actuellement, 13 soupes sur 35 et 35 alcools de stockage ont été séquencés par le CCDB. Les séquences ADN obtenues ont été identifiées par analyse bioinformatique de similarité avec les séquences des librairies de référence. Les deux listes des espèces (moléculaire et morphologique) ont ensuite été comparées.\nLe taux de détection des espèces par l'approche NGS est beaucoup plus forte et moins variable avec les soupes (82% +/- SD=12), qu'avec l'alcool de stockage (32% +/- SD=30). L'efficience de la détection moléculaire varie d'une famille à l'autre, et d'une espèce à l'autre au sein d'une même famille, indépendamment de la biomasse. Une seule des espèces présentes dans plus de 5 échantillons a été détectée dans 100% des cas. Pour l'ensemble des pièges, près de la moitié des espèces que les taxonomistes ne pouvaient pas identifier morphologiquement ont été identifiées formellement à l'espèce grâce aux séquences produites. Cette plus-value de l'identification moléculaire, concerne 74% des taxons supra-spécifiques dans les soupes et 30% pour l'alcool de stockage. L'analyse des séquences NGS livre des espèces additionnelles relevant de contaminants opératoires (dont l'ADN provient d'un autre échantillon) ou naturels (contenus digestifs de prédateurs dans le même relevé), ou de taxons omis par l'opérateur de tri. \nL'optimisation du protocole d'échantillonnage et de conditionnement pour maximiser le taux d'identification moléculaire est à approfondir. La combinaison [piège à alcool]x[non congélation des échantillons]x[non remplacement de l'alcool de stockage]x[séquençage des soupes] est une des trajectoires les plus efficaces d'après les premiers résultats NGS. Toutefois, le protocole d'identification moléculaire sur les échantillons totaux est destructeur, et rend impossible le retour à l'un des spécimens de la soupe initiale, en cas de besoin d'examen morphologique complémentaire. Dans notre étude, le métabarcoding de l'alcool de stockage, non destructeur pour les spécimens, présente des résultats trop variables et requiert de nouvelles investigations.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction machine sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.
Scores du classifieur distillé par catégorie (deux têtes)
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,005 | 0,006 |
| Méta-épidémiologie (sens strict) | 0,001 | 0,001 |
| Méta-épidémiologie (sens large) | 0,001 | 0,001 |
| Bibliométrie | 0,002 | 0,001 |
| Études des sciences et des technologies | 0,001 | 0,000 |
| Communication savante | 0,002 | 0,002 |
| Science ouverte | 0,001 | 0,001 |
| Intégrité de la recherche | 0,001 | 0,001 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,005 | 0,003 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».