Training data and ensemble results of an ensemble of models trained to find flowers on herbarium sheet images
Notice bibliographique
Résumé
This contains the 3 image datasets (training, validation, testing/holdout) for training models to identify flowers on images of herbarium sheets. Metadata for the images are located at https://github.com/rafelafrance/phenobase/blob/v1.0.0/datasets/splits_2025-04-22.csv. The 3 models were ultimately used in an ensemble for flower identification. flower_inference_formatted_2025-10-30.zip contains the formatted output of the ensemble and flower_inference_votes_2025-09-02.zip contains the raw ensemble votes. See the paper Petal to the metal? The slow road to automating large-scale phenology labeling for herbarium specimens Erin L. Grady1, Raphael LaFrance1, Daijiang Li2, Russell Dinnage3,4, Ellen G. Denny5, John Deck6 and Robert P. Guralnick1 1 Florida Museum of Natural History, University of Florida, Gainesville, Florida, USA 2 Department of Botany, University of Wisconsin-Madison, Madison, WI, USA 3 Department of Biological Sciences, University of Alberta, Edmonton, AB, Canada 4 Alberta Machine Intelligence Institute, Edmonton, AB, Canada 5 USA National Phenology Network, School of Natural Resources and the Environment, University of Arizona, Tucson, Arizona, USA 6 Berkeley Natural History Museums, University of California, Berkeley, California, USA Corresponding author: Erin Grady; gradyerin@ufl.edu
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction distillée sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Apprise à partir de 10 348 étiquettes directes de Codex et de 10 348 étiquettes directes de Gemma. Le mode candidate est l'union des têtes enseignantes seuillées; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont ni des étiquettes humaines ni des étiquettes directes de modèles de pointe.
Scores Codex et Gemma par catégorie
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,002 | 0,003 |
| Méta-épidémiologie (sens strict) | 0,000 | 0,000 |
| Méta-épidémiologie (sens large) | 0,001 | 0,000 |
| Bibliométrie | 0,000 | 0,001 |
| Études des sciences et des technologies | 0,001 | 0,000 |
| Communication savante | 0,000 | 0,000 |
| Science ouverte | 0,001 | 0,002 |
| Intégrité de la recherche | 0,000 | 0,000 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,002 | 0,000 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule tête enseignante, pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».