Manuel de GéoConnexions sur les données-cadre
Bibliographic record
Abstract
Bienvenue au Manuel de GéoConnexions sur les données-cadre. Ce cours en ligne est conçu pour vous présenter les concepts, les sources et les utilisations des données-cadre. Est-ce que votre travail exige que vous présentiez de l'information sous une forme géospatiale ou cartographique? Devez-vous rassembler des données géospatiales en provenance de sources diverses et les intégrer sur une carte de base commune? Avez-vous éprouvé des difficultés à trouver et à utiliser des données cartographiques de base communes? Si vous avez répondu oui à l'une ou l'autre de ces questions, ce manuel s'adresse à vous. Les données-cadre sont des données cartographiques de base communes qui offrent une référence géospatiale dans l'ensemble du Canada pour les entités physiques et d'autres types de données liées à la géographie. Ces données-cadre sont disponibles auprès d'un certain nombre de sources, à diverses échelles ou à divers niveaux de détail. Les données-cadre sont importantes puisqu'elles constituent le fondement pour l'intégration d'autres types de données, qui sont souvent essentielles à des fins d'analyse et pour l'établissement de rapports. Le manuel vise deux objectifs : vous informer sur les avantages des données-cadre; vous permettre de trouver des données-cadre et d'y avoir accès. Si vous possédez une formation générale sur les technologies de l'information ou si vous les utilisez pour analyser des données, préparer des graphiques et des rapports, mais que les données géospatiales et leur manipulation ne vous sont pas très familières, le présent manuel pourra vous aider. Après la lecture du manuel, vous saurez où trouver les données-cadre, vous comprendrez les avantages des diverses sources de données, vous serez en meilleure position pour choisir le type de données qui vous convient le mieux et vous saurez comment y avoir accès à partir de votre propre ordinateur.
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame machine prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.
Distilled classifier scores by category (both heads)
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.021 | 0.044 |
| Meta-epidemiology (narrow) | 0.002 | 0.002 |
| Meta-epidemiology (broad) | 0.001 | 0.002 |
| Bibliometrics | 0.005 | 0.008 |
| Science and technology studies | 0.005 | 0.007 |
| Scholarly communication | 0.018 | 0.024 |
| Open science | 0.004 | 0.012 |
| Research integrity | 0.003 | 0.009 |
| Insufficient payload (model declined to judge) | 0.029 | 0.012 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".