Classification automatique des diatomées : extraction et identification des structures taxonomiques
Notice bibliographique
Résumé
AvertissementL'auteur de ce mémoire ou de cette thèse a autorisé l'Université du Québec à Trois-Rivières à diffuser, à des fins non lucratives, une copie de son mémoire ou de sa thèse.Cette diffusion n'entraîne pas une renonciation de la part de l'auteur à ses droits de propriété intellectuelle, incluant le droit d'auteur, sur ce mémoire ou cette thèse.Notamment, la reproduction ou la publication de la totalité ou d'une partie importante de ce mémoire ou de cette thèse requiert son autorisation.Université du Québec à Thois-Rivières Service de la bibliothèque Avertissement L'auteur de ce mémoire ou de cette thèse a autorisé l'Université du Québec à Thois-Rivières à diffuser, à des fins non lucratives, une copie de son mémoire ou de sa thèse.Cette diffusion n'entraîne pas une renonciation de la part de l'auteur à ses droits de propriété intellectuelle, incluant le droit d'auteur, sur ce mémoire ou cette thèse.Notamment, la reproduction ou la publication de la totalité ou d'une partie importante de ce mémoire ou de cette thèse requiert son autorisation.« Nous piétinerons éternellement aux frontières de l'inconnu, cherchant à comprendre ce qui restera toujours incompréhensible.Et c'est précisément cela qui fait de nous des hommes.» Isaac Asimov À Gabriela Caro lin a, mon épouse.Mes remerciements vont premièrement à tous les membres de ma famille , spécialement à ma mère qui m'a donné son soutien et qui m 'a encouragé à effectuer mes études de cycle supérieur à l'étranger.J 'ai apprécié leur proximité malgré mon éloignement afin que je ne me sente pas trop loin de chez moi.Je veux aussi remercier ma fiancée Gabriela de m 'avoir accompagné pendant mon séjour à l'étranger et de l'aide qu 'elle m 'a apportée.Je remercie le programme Mitacs et la Fondation de l'UQTR pour le financement reçu lors de mes études de deuxième cycle en mathématiques et d'informatique à l'Université du Québec à Trois-Rivières (UQTR), sans leur contribution je n 'aurais pu réaliter ce projet de recherche.Finalement , je ne peux passer sous silence les précieux conseils des professeurs Fathallah Nouboud et Alain Chalifour du département de mathématiques et d 'informatique de l'UQTR et du professeur Yvon Voisin de l'Université de Bourgogne qui m 'ont invité à participer à ce projet et à entreprendre un programme de maîtrise à l'Université du Québec à Trois-Rivières.Ils m'ont apporté de multiples conseils et idées pour trouver le bon chemin afin de relever les défis de cette recherche.Merci à tous! Introd uctionLes diatomées sont des algues unicellulaires que l'on retrouve dans les milieux aquatiques.Leur structure consiste en une cellule unique, le frustule, formée de deux valves qui s'emboîtent.Étant donné leurs propriétés biologiques, elles sont d'excellents bioindicateurs et de grand intérêt dans plusieurs domaines scientifiques.Dans le cadre de plusieurs applications scientifiques utilisant les propriétés des diatomées, il est parfois nécessaire d 'identifier à l'espèce des spécimens de diatomées, et ce parmi plus de 100 000 espèces connues et distribuées dans les écosystèmes aquatiques de la planète.L'identification des diatomées, qui est faite généralement par des spécialistes à l'aide d 'un microscope binoculaire, s'effectue sur la base de patterns spécifiques tel la géométrie du contour et des ornementations du frustule.Ce projet a pour but de contribuer à la classification à l'espèce des diatomées , de manière automatique ou semi automatique, dans des conditions réelles de laboratoire.L'approche courante dans un tel cas consiste à extraire les caractéristiques nécessaires à la classification tel que la géométrie globale des spécimens (contour) , le mphé, les stries internes ou tout autre structure interne spécifique.Dans un premier temps, nous devons extraire les diatomées du fond bruité de l'image, saisie à l'aide d 'un binoculaire.À cet effet, nous segmentons l'image, afin de séparer le fond de la zone d'intérêt, en déterminant automatiquement deux seuils (optimaux) de séparation des niveaux de gris (intervalle) à partir de la fonction de répartition obtenue à partir de l'histogramme des niveaux de gris dans l'image.Il résulte de cette segmentation une image binaire contenant différentes régions , dont certaines appartiennent
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction machine sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.
Scores du classifieur distillé par catégorie (deux têtes)
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,001 | 0,001 |
| Méta-épidémiologie (sens strict) | 0,001 | 0,000 |
| Méta-épidémiologie (sens large) | 0,001 | 0,001 |
| Bibliométrie | 0,003 | 0,002 |
| Études des sciences et des technologies | 0,001 | 0,000 |
| Communication savante | 0,002 | 0,001 |
| Science ouverte | 0,001 | 0,001 |
| Intégrité de la recherche | 0,002 | 0,001 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,003 | 0,003 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».