Reconstructing spatial images from limited samples using supervised and semi-supervised learning algorithms
Bibliographic record
Abstract
La simulation et la modélisation des phénomènes naturels rencontrés dans les sciences de la terre, comme les caractéristiques des réservoirs pétroliers (par exemple, la porosité, la perméabilité, la saturation); les attributs de gisements minéraux (par exemple, la teneur en métal, les propriétés des roches); et les polluants spatiaux dans l'air, l'eau et le sol, est un problème important dans la géostatistique et l’ingénierie de mines. Afin de déterminer l'incertitude sous-jacente à ces phénomènes, plusieurs simulations stochastiques doivent être réalisées en utilisant des échantillons de données d’entrée réparties dans l'espace. Cependant, à cause du coût élevé de l'acquisition de données, seulement quelques échantillons de données sont disponibles pour ces simulations. Les modèles de référence, appelés images d’apprentissage, sont donc fréquemment utilisés par les techniques de l'état de l'art pour améliorer la qualité des simulations. Cependant, quand il y a un conflit entre l'image d’apprentissage et les échantillons de données, les techniques de simulation tendent à reproduire les statistiques de l'image d’apprentissage. Ce problème peut être résolu soit par la conception de nouvelles techniques de simulation guidée par les données d’entrée soit par la construction d’images d’apprentissage à partir de données.Dans cette thèse, nous posons le problème de la construction d'images d’apprentissage comme un problème d'apprentissage automatique afin d’inférer d’images spatiales complexes à partir d'échantillons limités de données. Nous présentons ainsi une nouvelle technique pour définir les caractéristiques d'usage général, motivées par la littérature scientifique en géostatistique, qui peuvent être utilisées par de différents algorithmes d'apprentissage. Ces caractéristiques encodent l'information spatiale des échantillons de données, y incluses la structure et la distribution des étiquettes. Utilisant ces caractéristiques, on applique les algorithmes de machines à vecteurs de support, un algorithme d'apprentissage supervisé, et un algorithme de propagation d’étiquettes, un algorithme d'apprentissage semi-supervisé à base de graphes, afin de reconstruire des images spatiales, multi-catégorie, binaires et à deux-dimensions, à partir d'échantillons de données limités. Finalement, on présente une extension d’algorithmes de propagation d'étiquettes, ou en général, d’algorithmes d’apprentissage semi-supervisés à base de graphes, où l'on apprend d'abord le graphe. Généralement, les algorithmes de construction de graphes explorent de différentes métriques de distance ou méthodes de sparsification sur les caractéristiques données. Cependant, nous proposons d'utiliser de valeurs de classification probabilistes, au lieu des caractéristiques, pour construire le graphe. Nous démontrons que cette extension fonctionne particulièrement bien pour les images multi-catégorie lorsque les échantillons de données disponibles sont très peu abondants.
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame distilled prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. Learned from the 10,348 direct Codex labels and 10,348 direct Gemma labels. Candidate is the union of thresholded teacher heads; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels or direct frontier model labels.
Codex and Gemma teacher scores by category
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.001 | 0.001 |
| Meta-epidemiology (narrow) | 0.000 | 0.000 |
| Meta-epidemiology (broad) | 0.000 | 0.000 |
| Bibliometrics | 0.000 | 0.000 |
| Science and technology studies | 0.001 | 0.000 |
| Scholarly communication | 0.000 | 0.001 |
| Open science | 0.000 | 0.001 |
| Research integrity | 0.000 | 0.001 |
| Insufficient payload (model declined to judge) | 0.001 | 0.000 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one teacher head, not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".