Benchmarking tree species classification from proximally sensed laser scanning data: Introducing the <scp>FOR</scp> ‐ <scp>species20K</scp> dataset
Notice bibliographique
Résumé
Abstract Proximally sensed laser scanning presents new opportunities for automated forest ecosystem data capture. However, a gap remains in deriving ecologically pertinent information, such as tree species, without additional ground data. Artificial intelligence approaches, particularly deep learning (DL), have shown promise towards automation. Progress has been limited by the lack of large, diverse, and, most importantly, openly available labelled single‐tree point cloud datasets. This has hindered both (1) the robustness of the DL models across varying data types (platforms and sensors) and (2) the ability to effectively track progress, thereby slowing the convergence towards best practice for species classification. To address the above limitations, we compiled the FOR‐species20K benchmark dataset, consisting of individual tree point clouds captured using proximally sensed laser scanning data from terrestrial (TLS), mobile (MLS) and drone laser scanning (ULS). Compiled collaboratively, the dataset includes data collected in forests mainly across Europe, covering Mediterranean, temperate and boreal biogeographic regions. It includes scattered tree data from other continents, totaling over 20,000 trees of 33 species and covering a wide range of tree sizes and forms. Alongside the release of FOR‐species20K, we benchmarked seven leading DL models for individual tree species classification, including both point cloud (PointNet++, MinkNet, MLP‐Mixer, DGCNNs) and multi‐view 2D‐based methods (SimpleView, DetailView, YOLOv5). 2D Image‐based models had, on average, higher overall accuracy (0.77) than 3D point cloud‐based models (0.72). Notably, the performance was consistently >0.8 across scanning platforms and sensors, offering versatility in deployment. The top‐scoring model, DetailView, demonstrated robustness to training data imbalances and effectively generalized across tree sizes. The FOR‐species20K dataset represents an important asset for developing and benchmarking DL models for individual tree species classification using proximally sensed laser scanning data. As such, it serves as a crucial foundation for future efforts to classify accurately and map tree species at various scales using laser scanning technology, as it provides the complete code base, dataset, and an initial baseline representative of the current state‐of‐the‐art of point cloud tree species classification methods.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction distillée sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Apprise à partir de 10 348 étiquettes directes de Codex et de 10 348 étiquettes directes de Gemma. Le mode candidate est l'union des têtes enseignantes seuillées; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont ni des étiquettes humaines ni des étiquettes directes de modèles de pointe.
Scores Codex et Gemma par catégorie
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,003 | 0,003 |
| Méta-épidémiologie (sens strict) | 0,000 | 0,000 |
| Méta-épidémiologie (sens large) | 0,000 | 0,000 |
| Bibliométrie | 0,000 | 0,000 |
| Études des sciences et des technologies | 0,001 | 0,000 |
| Communication savante | 0,000 | 0,000 |
| Science ouverte | 0,000 | 0,000 |
| Intégrité de la recherche | 0,000 | 0,000 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,000 | 0,000 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule tête enseignante, pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».