Deep Learning for Nematode Image-based Antiparasitic Drug Discovery
Notice bibliographique
Résumé
Deep learning has revolutionized the domain of computer vision, with various neural network architectures excelling in tasks like biomedical image classification. This thesis focuses on using deep learning methods to automate the classification of nematode images for drug discovery. The process involves visually examining thousands of images of C. elegans exposed to natural extracts for signs of abnormal development, including morphological defects and reproductive issues. Our dataset comprises 12,717 microscopic images associated with natural product extracts. Approximately one-third of the images are labeled by an expert, and the remaining are unlabeled. Depending on the drug discovery objective, we define the classification as binary (Normal/Abnormal), the most common six (including only the most common six phenotype combinations), or 27 classes (including all phenotype combinations). Initially, we explored fully supervised and semi-supervised learning approaches for binary classification, utilizing high-confidence pseudo-labels from the unlabeled data to progressively enrich our training dataset. To better identify groups with similar visual observations and improve the classification performance, we propose the Triple Cluster Classification (TriCC) method, which enables the detection of underlying feature patterns in C. elegans. TriCC includes self-supervised contrastive learning, unsupervised image clustering, and supervised classification using labeled data to map clusters to the phenotype combinations. Following this, we propose a semi-supervised nematode image classifier based on self-supervised representation learning with Mix-up Barlow Twins (MBT-NC). This system integrates self-supervised learning (SSL) for feature representation (MBT) with a supervised classification stage (NC). We use additional linear interpolated samples in MBT to enhance batch information utilization. The MBT-NC outperforms the two previously developed methods, achieving test accuracies of 89.6%, 83.4%, and 77.6% for binary, six-class, and twenty-seven-class classifications, respectively.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction machine sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.
Scores du classifieur distillé par catégorie (deux têtes)
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,001 | 0,001 |
| Méta-épidémiologie (sens strict) | 0,001 | 0,000 |
| Méta-épidémiologie (sens large) | 0,001 | 0,001 |
| Bibliométrie | 0,001 | 0,001 |
| Études des sciences et des technologies | 0,000 | 0,000 |
| Communication savante | 0,001 | 0,001 |
| Science ouverte | 0,001 | 0,001 |
| Intégrité de la recherche | 0,001 | 0,001 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,002 | 0,001 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».