Comprehensive database of secondary metabolites from cyanobacteria
Notice bibliographique
Résumé
Abstract Cyanobacteria form harmful mass blooms in freshwater and marine environments around the world. A range of secondary metabolites has been identified from cultures of cyanobacteria and biomass collected from cyanobacterial bloom events. A comprehensive database is necessary to correctly identify cyanobacterial metabolites and advance research on their abundance, persistence and toxicity in natural environments. We consolidated open access databases and manually curated missing information from the literature published between 1970 and March 2020. The result is the database CyanoMetDB, which includes more than 2000 entries based on more than 750 literature references. This effort has more than doubled the total number of entries with complete literature metadata and structural composition (SMILES codes) compared to publicly available databases to this date. Over the past decade, more than one hundred additional secondary metabolites have been identified yearly. We organized all entries into structural classes and conducted substructure searches of the provided SMILES codes. This approach demonstrated, for example, that 65% of the compounds carry at least one peptide bond, 57% are cyclic compounds, and 30% carry at least one halogen atom. Structural searches by SMILES code can be further specified to identify structural motifs that are relevant for analytical approaches, research on biosynthetic pathways, bioactivity-guided analysis, or to facilitate predictive science and modeling efforts on cyanobacterial metabolites. This database facilitates rapid identification of cyanobacterial metabolites from toxic blooms, research on the biosynthesis of cyanobacterial natural products, and the identification of novel natural products from cyanobacteria.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction distillée sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Apprise à partir de 10 348 étiquettes directes de Codex et de 10 348 étiquettes directes de Gemma. Le mode candidate est l'union des têtes enseignantes seuillées; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont ni des étiquettes humaines ni des étiquettes directes de modèles de pointe.
Scores Codex et Gemma par catégorie
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,000 | 0,000 |
| Méta-épidémiologie (sens strict) | 0,001 | 0,001 |
| Méta-épidémiologie (sens large) | 0,001 | 0,000 |
| Bibliométrie | 0,000 | 0,000 |
| Études des sciences et des technologies | 0,000 | 0,000 |
| Communication savante | 0,000 | 0,000 |
| Science ouverte | 0,001 | 0,001 |
| Intégrité de la recherche | 0,001 | 0,001 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,001 | 0,000 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule tête enseignante, pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».