Bibliographic record
Abstract
Les mégadonnées promettent de nombreux avantages pour la recherche sur les Changements dès l'Utilisation/Couverture des Terres (CUCT), en termes d'augmentation du volume, de la rapidité et de la variété des images de télédétection. Cependant, il conteste les approches traditionnelles pour identifier des CUCT. Le volume accru (taille du fichier) et la rapidité (vitesse) des mégadonnées signifient que les cadres de gestion des données existants ne peuvent pas distribuer efficacement des données spatiales et des computations sur un grand nombre d'ordinateurs. Les flux de travail des CUCT précédents ne sont pas conçus pour des mégadonnées et ne peuvent pas être facilement déployés sur des outils mégadonnées tels que le cloud computing et le cadre Hadoop. Les niveaux élevés d'hétérogénéité des échelles signifient que les images peuvent couvrir granularités et étendues différentes, spatiales et temporelles. Théoriquement, il devient difficile de s'occuper les données à cause de significations d'échelle multiples et conflictuelles. Parce que nous travaillons avec les mégadonnées, les entités géographiques peuvent être enregistrés à granularités et extensions différentes qui devraient être détectées comme des CUCT mais ne peuvent pas être. Enfin, ces problèmes n'ont pas été explorés ensemble pour les défis des mégadonnées dans les CUCT.Je présente six avancées pour répondre aux défis des mégadonnées dans les CUCT: (1) un concept théorique s’appelé Scope, (2) une méthode de décomposition / recomposition spatialement sensible, (3) une méthode de détection de changement invariant à l'échelle, (4) un modèle spatio-temporel pour les mégadonnées dans les CUCT, (5) un algorithme d'optimisation des limites de changement, et (6) une geospatial cyberinfrastructure spécifique aux CUCT. Dans ce manuscrit, je propose d'abord le Scope comme un conception pour modéliser les échelles spatio-temporelles en fusionnant explicitement la granularité, l'étendue, le temps et la propriété. Deuxièmement, je développe un nouveau cadre de décomposition / recomposition pour gérer la décomposition, la distribution, et la recombinaison des données dans un environnement computation distribué. Troisièmement, une méthode de détection de changement invariable à l'échelle identifie CUCT en combinant les caractéristiques régionales et ponctuelles ensembles des données à plusieurs granularités et étendues spatiales. Quatrièmement, je théorise un modèle d'objet spatio-temporel pour améliorer l'intégration de l'espace et du temps dans la recherche des CUCT. Le modèle d'objet spatio-temporel, et la cinquième avancée, un algorithme d'optimisation des limites de changement gèrent le bruit des données et organisent mieux les changements de l'objet spatial-temporel. Enfin, une geospatial cyberinfrastructure combine ces approches distinctes avec le cloud computing et les cadres computations distribués comme une approche holistique pour le défi des mégadonnées dans la recherche des CUCT. Ces six avancées sont testées dans une série d'études de cas en utilisant des données collectées depuis 2005 à 2012, dans la région plus grande de Montréal.
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame distilled prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. Learned from the 10,348 direct Codex labels and 10,348 direct Gemma labels. Candidate is the union of thresholded teacher heads; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels or direct frontier model labels.
Codex and Gemma teacher scores by category
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.003 | 0.001 |
| Meta-epidemiology (narrow) | 0.000 | 0.000 |
| Meta-epidemiology (broad) | 0.000 | 0.000 |
| Bibliometrics | 0.000 | 0.001 |
| Science and technology studies | 0.001 | 0.000 |
| Scholarly communication | 0.000 | 0.003 |
| Open science | 0.001 | 0.000 |
| Research integrity | 0.000 | 0.000 |
| Insufficient payload (model declined to judge) | 0.000 | 0.000 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one teacher head, not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".