Exploring XmoA gene profiles in Saanich Inlet with TreeSAPP
Notice bibliographique
Résumé
This is a package of FASTQ and FASTA files containing subsetted data from Saanich Inlet Cruise 72. These data are intended for the purpose of demonstrating the utility of TreeSAPP for gene-centric metagenome interpretation. This dataset is integrated with UBC's Microbiology and Immunology class, MICB425. A bookdown for the tutorial is available on GitHub: https://github.com/EDUCE-UBC/MICB425 Sequences were subset according to their relationship to the XmoA (CuMMO protein family) gene. Content: 6.9M SI072_100m_MetaT_QC_Filtered.fq.gz 741K SI072_100m_pe.1.fq.gz 739K SI072_100m_pe.2.fq.gz 31K SI072_10m_MetaT_QC_Filtered.fq.gz 12K SI072_10m_pe.1.fq.gz 13K SI072_10m_pe.2.fq.gz 6.4M SI072_120m_MetaT_QC_Filtered.fq.gz 563K SI072_120m_pe.1.fq.gz 561K SI072_120m_pe.2.fq.gz 6.3M SI072_135m_MetaT_QC_Filtered.fq.gz 638K SI072_135m_pe.1.fq.gz 637K SI072_135m_pe.2.fq.gz 6.1M SI072_150m_MetaT_QC_Filtered.fq.gz 538K SI072_150m_pe.1.fq.gz 535K SI072_150m_pe.2.fq.gz 1.4M SI072_165m_MetaT_QC_Filtered.fq.gz 951K SI072_165m_pe.1.fq.gz 947K SI072_165m_pe.2.fq.gz 114K SI072_200m_MetaT_QC_Filtered.fq.gz 75K SI072_200m_pe.1.fq.gz 75K SI072_200m_pe.2.fq.gz 18M SI072_MAGs.fa 8.2K SI072_MAGs_gtdbtk.bac120.summary.tsv 85K SI072_MetaG_contigs.fasta
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction machine sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.
Scores du classifieur distillé par catégorie (deux têtes)
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,001 | 0,002 |
| Méta-épidémiologie (sens strict) | 0,001 | 0,001 |
| Méta-épidémiologie (sens large) | 0,001 | 0,001 |
| Bibliométrie | 0,003 | 0,004 |
| Études des sciences et des technologies | 0,001 | 0,000 |
| Communication savante | 0,002 | 0,001 |
| Science ouverte | 0,001 | 0,002 |
| Intégrité de la recherche | 0,001 | 0,001 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,025 | 0,024 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».