La géographie est-elle une science? Introduction aux problèmes de codification dans le traitement automatique de l’information géographique
Bibliographic record
Abstract
Le présent article est à la fois une introduction épistémologique à la géographie et une approche sémantique du langage, fort complexe, qu'emploient les géographes. Son but est d'inviter à la réflexion sur les problèmes que pose la codification de l'information géographique pour un traitement automatique. Comme toutes les disciplines chargées de gérer et de présenter un « corps de savoir », la géographie est aujourd'hui confrontée à l'accumulation accélérée de la masse documentaire qu'elle utilise. Les éléments qui composent son corps de savoir viennent pour la plupart d'autres sciences et d'autres disciplines, d'un degré de complexité moindre, qui lui fournissent des informations concernant la Terre et les Hommes. Le rôle du géographe est de synthétiser ces apports en vue de rendre compte de la répartition des faits physiques ou humains considérés à la surface du globe et d'en produire une expression cartographique ; son point de vue est celui d'un généraliste. Toutefois, la géographie ne s'intéresse pas aux faits sur le seul plan statistique ; elle considère encore leurs rapports et leur genèse, voire leur devenir en ce qu'ils sont, eux aussi, susceptibles de représentation cartographique. Il n'y a donc pas, à proprement parler, d'information géographique, mais une manière géographique de dresser la synthèse d'informations de provenances diverses. Or, chaque source d'information a son langage propre, de sorte que le langage géographique procède pour une grande part d'emprunts et ne dispose d'un langage spécifique qu'à partir d'un certain degré de synthèse. Il en résulte que, n'étant ni une science ni une discipline scientifique, même lorsqu'elle s'équipe de méthodes pour « percevoir et pénétrer » du nouveau, la géographie ne peut pas se plier à une codification unique, sous la forme d'un thésaurus de mots-clés. Il lui faut au moins trois ordres de codes aptes à un jeu de combinaisons : 1 — Un code géographique, pour la localisation à la surface du globe ; un système de coordonnées par exemple ; 2 — Un code taxonomique, c'est-à-dire un vocabulaire des « maîtres-mots » qui portent l'esprit même de la préoccupation géographique et constituent la classification typologique propre à la discipline ; 3 — Un code syntaxique, où notamment les emprunts faits à d'autres langages seraient à faire jouer comme des données grammaticales. Par la logique même de l'argumentation, des notions comme science, discipline, connaissance, corps de savoir ont trouvé l'occasion d'être précisées.
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame machine prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.
Distilled classifier scores by category (both heads)
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.012 | 0.029 |
| Meta-epidemiology (narrow) | 0.001 | 0.001 |
| Meta-epidemiology (broad) | 0.001 | 0.002 |
| Bibliometrics | 0.005 | 0.007 |
| Science and technology studies | 0.003 | 0.020 |
| Scholarly communication | 0.020 | 0.024 |
| Open science | 0.003 | 0.007 |
| Research integrity | 0.004 | 0.006 |
| Insufficient payload (model declined to judge) | 0.008 | 0.002 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".