High throughput DNA barcoding to assess the diversity of Laurentian insects
Notice bibliographique
Résumé
La grande diversité d’insectes et la quantité de spécimens recueillis lors de l’échantillonnage constituent les plus grands défis de la systématique des insectes. Le tri des échantillons au niveau des espèces est nécessaire avant qu’ils puissent être utilisés pour des enquêtes sur les modèles de biodiversité. En raison de l’obstacle taxonomique, le manque d’expertise taxonomique, de nombreuses études sur la diversité des insectes classe les spécimens en Unités Morphologiques Opérationnelles (MorphOTUs), aussi appelées morpho-espèces, en désignant les groupes définis subjectivement en fonction de caractéristiques morphologiques évidentes. Cependant, il est long et douteux de définir avec précision les limites des espèces en se fondant sur les MorphOTUs, surtout dans les groupes où il y a de minuscules insectes et une grande similarité au niveau des espèces, comme chez les Hyménoptères. Le codage à barres de l’ADN, une approche taxonomique discriminatoire qui utilise des séquences d’ADN, a accéléré la classification taxonomique et peut être une approche alternative aux MorphOTUs. Cependant, il est crucial d’utiliser une stratégie fiable et économique de codage à barres ADN pour traiter un grand nombre d’échantillons. En outre, le codage à barres d’ADN devrait fonctionner avec les espèces problématiques dans l’entomologie moléculaire comme on l'observe parfois avec les hyménoptères. Afin de mettre en œuvre une évaluation rapide de la biodiversité des Hyménoptères, optimiser les de étapes de barcodage d`ADN (extraction d’ADN, amplification par PCR et séquençage) était le premier objectif de ce projet de recherche. On a testé et optimisé une extraction d’ADN arrivant à une méthode coûtante 0,20 dollars par spécimen. On a validé la performance adéquate des mini-codes à barres d’ADN, réduits en taille à 313bp, pour établir une classification d’Unités Taxonomiques Opérationnelles Moléculaires (MOTUs) comparable à celle du codage à barres d’ADN couramment utilisé, de longueur de 658bp. On a adopté ce protocole optimisé pour le codage à barres de 517 spécimens d’Hyménoptères échantillonnés par des pièges aspirateurs situés dans la forêt laurentienne de l’Est du Canada. Avec le séquençage multiplexé à haut débit Illumina, impliquant des amplicons étiquetés, on a obtenu des mini-codes à barres pour 88% des spécimens. Le coût et le temps nécessaires pour générer des données MOTU, grâce à notre approche de codage à barres d’ADN, étaient environ la moitié de celui de la classification morphologique en MorphOTUs. Le deuxième objectif de ma recherche était de comparer l’efficacité du tri morphologique des MorphOTUs avec l’identification moléculaire et la délimitation par MOTUs. On a démontré iii une forte congruence entre l’identification morphologique et moléculaire au niveau taxonomique de la famille dansla base de données Barcode of Life (BOLD) et GenBank (93 %), alors que seulement 18 % des mini-codes à barres ont été attribués à des identifications plus précises (genre ou espèce). La délimitation moléculaire s’est faite avec quatre méthodes de regroupement différentes (basée sur la distance : Découverte automatique de l’écart de codes à barres (ABGD) et Assemblage des espèces par partitionnement automatique (ASAP) ; basée sur un dendrogramme : Coalescente mixte généralisée du yule (GMYC) et Processus bayésien de l’arbre de poisson (bPTP)). En générale, les méthodes moléculaires ont plus que doublé la diversité estimée des MorphOTUs des Hyménoptères. Les MOTUs étaient en grande partie incompatibles avec les MorphOTUs (ratio d’appariement <0,35). Les méthodes basées sur la distance ont donné des résultats plus conformes au tri morphologique que les méthodes basées sur les arbres, en particulier dans la superfamille des Chalcidoidea. Compte tenu de la comparaison entre le coût et le temps des méthodes de classification moléculaire et morphologique, nos résultats suggèrent que le codage à barres mini-ADN pour estimer la diversité des espèces d’Hyménoptères est plus économique que le tri par MorphOTU. Cependant, bien que les méthodes MorphOTU et MOTU aient donné de nombres unités taxonomiques différentes, les analyses de la diversité utilisées actuellement tiennent compte de l’abondance et d’autres paramètres. On n’a pas évalué si les MorphOTUs et les protocoles d’entente donneraient des résultats suffisamment équivalents dans la recherche réelle sur les diversités α et β, c’est-à-dire pour évaluer s’ils pouvaient tout de même tous deux être utiles.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction machine sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.
Scores du classifieur distillé par catégorie (deux têtes)
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,001 | 0,002 |
| Méta-épidémiologie (sens strict) | 0,000 | 0,000 |
| Méta-épidémiologie (sens large) | 0,000 | 0,000 |
| Bibliométrie | 0,003 | 0,001 |
| Études des sciences et des technologies | 0,001 | 0,000 |
| Communication savante | 0,001 | 0,001 |
| Science ouverte | 0,001 | 0,001 |
| Intégrité de la recherche | 0,000 | 0,000 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,003 | 0,001 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».