High throughput DNA barcoding to assess the diversity of Laurentian insects
Bibliographic record
Abstract
La grande diversité d’insectes et la quantité de spécimens recueillis lors de l’échantillonnage constituent les plus grands défis de la systématique des insectes. Le tri des échantillons au niveau des espèces est nécessaire avant qu’ils puissent être utilisés pour des enquêtes sur les modèles de biodiversité. En raison de l’obstacle taxonomique, le manque d’expertise taxonomique, de nombreuses études sur la diversité des insectes classe les spécimens en Unités Morphologiques Opérationnelles (MorphOTUs), aussi appelées morpho-espèces, en désignant les groupes définis subjectivement en fonction de caractéristiques morphologiques évidentes. Cependant, il est long et douteux de définir avec précision les limites des espèces en se fondant sur les MorphOTUs, surtout dans les groupes où il y a de minuscules insectes et une grande similarité au niveau des espèces, comme chez les Hyménoptères. Le codage à barres de l’ADN, une approche taxonomique discriminatoire qui utilise des séquences d’ADN, a accéléré la classification taxonomique et peut être une approche alternative aux MorphOTUs. Cependant, il est crucial d’utiliser une stratégie fiable et économique de codage à barres ADN pour traiter un grand nombre d’échantillons. En outre, le codage à barres d’ADN devrait fonctionner avec les espèces problématiques dans l’entomologie moléculaire comme on l'observe parfois avec les hyménoptères. Afin de mettre en œuvre une évaluation rapide de la biodiversité des Hyménoptères, optimiser les de étapes de barcodage d`ADN (extraction d’ADN, amplification par PCR et séquençage) était le premier objectif de ce projet de recherche. On a testé et optimisé une extraction d’ADN arrivant à une méthode coûtante 0,20 dollars par spécimen. On a validé la performance adéquate des mini-codes à barres d’ADN, réduits en taille à 313bp, pour établir une classification d’Unités Taxonomiques Opérationnelles Moléculaires (MOTUs) comparable à celle du codage à barres d’ADN couramment utilisé, de longueur de 658bp. On a adopté ce protocole optimisé pour le codage à barres de 517 spécimens d’Hyménoptères échantillonnés par des pièges aspirateurs situés dans la forêt laurentienne de l’Est du Canada. Avec le séquençage multiplexé à haut débit Illumina, impliquant des amplicons étiquetés, on a obtenu des mini-codes à barres pour 88% des spécimens. Le coût et le temps nécessaires pour générer des données MOTU, grâce à notre approche de codage à barres d’ADN, étaient environ la moitié de celui de la classification morphologique en MorphOTUs. Le deuxième objectif de ma recherche était de comparer l’efficacité du tri morphologique des MorphOTUs avec l’identification moléculaire et la délimitation par MOTUs. On a démontré iii une forte congruence entre l’identification morphologique et moléculaire au niveau taxonomique de la famille dansla base de données Barcode of Life (BOLD) et GenBank (93 %), alors que seulement 18 % des mini-codes à barres ont été attribués à des identifications plus précises (genre ou espèce). La délimitation moléculaire s’est faite avec quatre méthodes de regroupement différentes (basée sur la distance : Découverte automatique de l’écart de codes à barres (ABGD) et Assemblage des espèces par partitionnement automatique (ASAP) ; basée sur un dendrogramme : Coalescente mixte généralisée du yule (GMYC) et Processus bayésien de l’arbre de poisson (bPTP)). En générale, les méthodes moléculaires ont plus que doublé la diversité estimée des MorphOTUs des Hyménoptères. Les MOTUs étaient en grande partie incompatibles avec les MorphOTUs (ratio d’appariement <0,35). Les méthodes basées sur la distance ont donné des résultats plus conformes au tri morphologique que les méthodes basées sur les arbres, en particulier dans la superfamille des Chalcidoidea. Compte tenu de la comparaison entre le coût et le temps des méthodes de classification moléculaire et morphologique, nos résultats suggèrent que le codage à barres mini-ADN pour estimer la diversité des espèces d’Hyménoptères est plus économique que le tri par MorphOTU. Cependant, bien que les méthodes MorphOTU et MOTU aient donné de nombres unités taxonomiques différentes, les analyses de la diversité utilisées actuellement tiennent compte de l’abondance et d’autres paramètres. On n’a pas évalué si les MorphOTUs et les protocoles d’entente donneraient des résultats suffisamment équivalents dans la recherche réelle sur les diversités α et β, c’est-à-dire pour évaluer s’ils pouvaient tout de même tous deux être utiles.
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame machine prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.
Distilled classifier scores by category (both heads)
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.001 | 0.002 |
| Meta-epidemiology (narrow) | 0.000 | 0.000 |
| Meta-epidemiology (broad) | 0.000 | 0.000 |
| Bibliometrics | 0.003 | 0.001 |
| Science and technology studies | 0.001 | 0.000 |
| Scholarly communication | 0.001 | 0.001 |
| Open science | 0.001 | 0.001 |
| Research integrity | 0.000 | 0.000 |
| Insufficient payload (model declined to judge) | 0.003 | 0.001 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".