Examen préliminaire de l'efficacité de plusieurs algorithmes de détection acoustique automatique des vocalises de baleine noire de l'Atlantique Nord, et recommandations par rapport aux prochaines étapes relatives à l'évaluation et à l'optimisation de ces algorithmes
Notice bibliographique
Résumé
La détection et la classification automatisées des vocalises de baleine noire de l’Atlantique Nord et d’autres mammifères marins sont hautement souhaitables pour les chercheurs et les gestionnaires qui cherchent à surveiller leur présence dans certaines zones afin de mettre en œuvre des mesures d’atténuation. Ce type de traitement acoustique automatisé est particulièrement important pour les approches de surveillance en temps réel qui traitent de grandes quantités de données acoustiques. Tous les systèmes de détection et de classification (SDC) utilisés par Pêches et Océans Canada (MPO) doivent offrir des résultats similaires, compte tenu des données (p. ex., heures avec vocalise/jour) utilisées pour présenter les occurrences de baleine noire de l’Atlantique Nord dans le temps, ce qui a déjà été démontré en comparant l’efficacité de divers détecteurs lors d’études menées en 2004, 2013 et 2017. Le Spectroplotter (un programme commercial) et le système de détection et de classification des basses fréquences (LFDCS, pour Low Frequency Detection and Classification System), deux systèmes ayant été utilisés pour analyser les données acoustiques dans la région de Terre-Neuve-et-Labrador et la région des Maritimes, donnent de bons résultats, bien que dans une petite étude, le LFDCS ait détecté plus de véritables vocalises de contact à modulation ascendante de baleine noire de l’Atlantique Nord que le Spectroplotter, mais ait également généré plus de faux positifs. L’efficacité d’un SDC est influencée par de multiples facteurs, y compris les niveaux de bruit ambiant par rapport aux caractéristiques de la vocalise de contact à modulation ascendante de la baleine noire de l’Atlantique Nord, l’emplacement de l’hydrophone, les caractéristiques du système d’enregistrement, les réglages et les seuils du logiciel, et d’autres caractéristiques contextuelles, comme la présence d’autres espèces. La prochaine génération de SDC intégrera le contexte dans sa logique (p. ex., la présence d’autres mammifères marins ou de sources sonores abiotiques et le rapport signal sur bruit). Les comparaisons d’algorithmes sont moins importantes dans les analyses historiques de la baleine noire de l’Atlantique Nord puisque les données qui découlent des résultats de détection actuels sont présentées à une échelle suffisamment grande (« Une baleine noire de l’Atlantique Nord a-t-elle été détectée à proximité de cet enregistreur aujourd’hui »?) pour que les légères différences en matière d’efficacité des algorithmes ne soient pas perceptibles après le processus d’amalgamation et de cumul. À des échelles d’échantillonnage spatiales et temporelles plus petites, les différences en matière d’efficacité des algorithmes deviennent plus visibles. Un test complet des différents SDC utilisés au Canada atlantique nécessiterait une série d’ensembles de données acoustiques validées manuellement et provenant d’un ensemble représentatif de lieux, de périodes, de saisons et de matériel d’enregistrement. Comparer ainsi les SDC serait une activité utile, mais nécessiterait que des mesures et des seuils de rendement soient établis pour ceux-ci.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction machine sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.
Scores du classifieur distillé par catégorie (deux têtes)
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,005 | 0,012 |
| Méta-épidémiologie (sens strict) | 0,002 | 0,001 |
| Méta-épidémiologie (sens large) | 0,001 | 0,001 |
| Bibliométrie | 0,002 | 0,001 |
| Études des sciences et des technologies | 0,001 | 0,001 |
| Communication savante | 0,003 | 0,002 |
| Science ouverte | 0,001 | 0,001 |
| Intégrité de la recherche | 0,002 | 0,001 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,004 | 0,003 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».