Classification automatique de nuages de points issus de LiDAR aéroporté par réseau à convolutions continues
Bibliographic record
Abstract
Les données issues de LiDAR aéroporté permettent de modéliser de façon précise la topographie d’un territoire et sont utilisées dans différents contextes. Le processus de classification du nuage de points permet d’assigner une classe d’occupation du sol à chacun des points. La quantité et la répartition non homogène de ces points complexifient grandement l’automatisation de cette tâche. Pour certaines classes d’objets, les algorithmes traditionnels ne réussissent pas à classifier correctement les points avec un niveau de qualité satisfaisant. C’est le cas pour les classes "bâtiments", "plans d’eau" et "végétation". Ce faisant, cette étape nécessite une intervention manuelle importante afin de corriger la classification effectuée automatiquement, augmentant ainsi le coût de valorisation de ces données. Le succès des algorithmes d’apprentissage profond en vision par ordinateur a mené à une révolution dans différents domaines, notamment en traitement d’images satellitaires. Ces succès ont inspiré diverses recherches sur la classification de nuages de points. La plupart de ces recherches portent sur le traitement de nuages de points issus de LiDAR mobile terrestre, mais elles peuvent très bien être adaptées pour le traitement de données LiDAR aéroporté. Cette recherche vise à utiliser une méthode d’apprentissage profond pour permettre une automatisation du processus de classification de nuages de points aéroportés, en évaluant une méthode sur deux jeux de données de contextes variés (urbain et rural), puis en modifiant la méthode de sélection des sous-ensembles de points pour qu’elle soit adaptée à la densité locale. La méthode originale a été testée sur deux jeux de données couvrant près de 16 000 km2, près de Montréal (QC) et de St-Jean (NB) et l’amélioration a été évaluée sur le jeu de données de référence DALES. La méthodologie utilisée est basée sur une adaptation de l’opération de convolution de Boulch (2020) appelée ConvPoint. Cette opération de convolution continue a été utilisée dans une architecture de type encodeur-décodeur qui permet de classifier les points directement, sans avoir recours à une étape de sursegmentation. En expérimentant avec différentes configurations, nous avons obtenu d'excellents résultats d'Intersection-sur-Union (IoU) pour les classes "Végétation moyenne-haute" (93 %) et "Bâtiment" (86 %) sur les ensembles de données de Montréal et Saint-Jean. La taille de bloc adaptative a conduit à certains gains de performances sur le jeu de données de référence DALES ainsi qu'à une sensibilité réduite aux hyperparamètres de la ConvPoint.
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame machine prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.
Distilled classifier scores by category (both heads)
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.001 | 0.002 |
| Meta-epidemiology (narrow) | 0.001 | 0.000 |
| Meta-epidemiology (broad) | 0.001 | 0.001 |
| Bibliometrics | 0.001 | 0.001 |
| Science and technology studies | 0.000 | 0.001 |
| Scholarly communication | 0.001 | 0.001 |
| Open science | 0.001 | 0.001 |
| Research integrity | 0.001 | 0.001 |
| Insufficient payload (model declined to judge) | 0.002 | 0.001 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".