MétaCan
Menu
Retour à la cohorte
Enregistrement W2746078860 · doi:10.13034/jsst.v10i1.123

Implementation of virtual workflows in KNIME for medicinal chemistry

2017· article· en· W2746078860 sur OpenAlexvenueaboutno aff
Jack Antonio DiTommaso

Notice bibliographique

RevueJournal of Student Science and Technology · 2017
Typearticle
Langueen
DomaineBiochemistry, Genetics and Molecular Biology
ThématiqueBiomedical Text Mining and Ontologies
Établissements canadiensnon disponible
Organismes subventionnairesnon disponible
Mots-clésWorkflowComputer scienceData scienceChemistWorld Wide WebChemistryDatabase

Résumé

récupéré en direct d'OpenAlex

This project demonstrates how two programs are created in KNIME - an open source data analytic, reporting and integration platform, are used to support research scientists in medicinal chemistry. The first application flags pan-assay interference compounds such as “promiscuous” compounds present in chemical libraries that recurrently behaves as false positive hits in screening campaigns. The second application adapted a previously published workflow, where it automatically scans the recently published scientific literature on a weekly basis, and identifies articles considered relevant to medicinal chemists focused on epigenetic mechanisms, a novel and promising field in drug discovery. These workflows are very important because they allow a user with relatively little training to be able to extract important data that would typically need a trained chemist for. The PAINS workflow performed adequately but data was problematic. This workflow and an online tool, used to compare results, agged different, but overlapping sets of compounds. The PubMed alert workflow performed very well, being able to consistently identify new papers. These workflows have been implemented at the Structural Genomics Consortium, in Toronto. Both Workflows are available at http://sgc.utoronto.ca/ditommaso.zip The implementation of these workflows demonstrate that the process is viable, and paves the way for the implementation of more complex workflows. Ce projet montre comment deux logiciels qui ont été créés en utilisant KNIME - une plate-forme open-source d’intégration et de reportage de data analytique, sont utilisées comme soutient pour les chercheurs dans le domaine de chimie médicale. La première application signale les composés d’interférence pan-essai (PAINS), par exemples des composés ‘libérés’ présents dans les chimiothèques, qui s’agissent souvent comme des fausses réactions positives pendant les campagnes de dépistage. La deuxième application, le système de workflow PubMed alert, a adapté un système de workflow développé auparavant qui parcourt rapidement la littérature scientifique publiée récemment une fois par semaine et identifie des articles qui sont pertinents pour des chimistes médicales qui étudient des mécaniques épigénétiques, un domaine novateur et prometteur dans les découvertes des drogues. Ces systèmes de workflow sont très importants car ils permettent un utilisateur avec relativement peu d’entraînement à soutirer des données importantes qui ont typiquement besoin d’être trouvées par les chimistes entraînés. Le système de workflow de PAINS a fonctionné suffisamment mais les données trouvées étaient problématiques. Le système et un outil en ligne utilisé pour la comparaison des résultats ont signalés des résultats différents, mais les résultats se sont débordés sur les unes les autres. Nous avons trouvés que le système de workflow PubMed alert a très bien fonctionné, car le système pouvait constamment identifier des nouveaux papiers scientifiques. Ces systèmes de workflow sont maintenant implémentés au Consortium Génomique Structurel (SGC) à Toronto. Les deux systèmes de workflow sont disponibles à http://sgc.utoronto.ca/ditommaso.zip. L’implémentation de ces systèmes de workflow montre que le procès est viable et ouvre la voie pour l’implémention des systèmes de workflow plus complexes.

Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.

Comment cette classification a été obtenuedéplier

Prédiction machine sur la base complète

Imitation des enseignants

Ni prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.

score de la tête « metaresearch » (Codex)0,012
score de la tête « metaresearch » (Gemma)0,018
Version: metacan-v3-hybrid-931329e0061cStatut de validation: machine_predicted_unvalidated
Catégories candidatesaucune
Catégories consensuellesaucune
DomaineSignal candidat: aucune · Signal consensuel: aucune
Devis d'étudeSignal candidat: Expérimental (laboratoire) · Signal consensuel: aucune
GenreSignal candidat: Méthodes · Signal consensuel: Méthodes
Score de désaccord entre enseignants0,012
Score d'incertitude au seuil0,066

Scores du classifieur distillé par catégorie (deux têtes)

CatégorieCodexGemma
Métarecherche0,0120,018
Méta-épidémiologie (sens strict)0,0020,002
Méta-épidémiologie (sens large)0,0010,003
Bibliométrie0,0020,002
Études des sciences et des technologies0,0010,002
Communication savante0,0050,005
Science ouverte0,0040,005
Intégrité de la recherche0,0010,003
Charge utile insuffisante (le modèle a refusé de juger)0,0110,008

Scores machine (provisoires)

Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.

Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.

Tête enseignante Opus0,016
Tête enseignante GPT0,374
Écart entre enseignants0,358 · la distance entre les deux têtes enseignantes sur ce seul travail
Statut de validationscore_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découle

Classification

machine, non validée

Prédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.

Les modèles n’ont appliqué aucune catégorie : rien dans la taxonomie ne correspondait à ce travail.
Devis d'étudeExpérimental (laboratoire)
Domainenon disponible
GenreMéthodes

Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».

En bref

Citations0
Publié2017
Routes d'admission2
Résumé présentoui

Explorer davantage

Même revueJournal of Student Science and TechnologyMême sujetBiomedical Text Mining and OntologiesTravaux en français237 207