Le fichier-réseau de la population du Saguenay : l’état du travail
Bibliographic record
Abstract
Créé en 1972, à l’Université du Québec à Chicoutimi, le Programme de recherches sur la société saguenayenne réunit une équipe pluridisciplinaire formée d’informaticiens, de démographes, de médecins, de sociologues et d’historiens. Il a pour but de constituer pour l’ensemble d’une société régionale et pour la période allant de 1840 à nos jours, un registre informatisé et universel fondé sur le jumelage automatique de données nominatives. Plus de 250 000 actes de baptêmes, de mariages et de sépultures ont déjà été dépouillés, validés et portés sur disque. L’ensemble du programme comporte un peu plus de 400 000 actes. Parallèlement, l’exploitation des recensements nominatifs du gouvernement canadien soit ceux de 1852, 1861 et 1871, ainsi que de la moitié environ des recensements paroissiaux entre 1880 et 1941 a permis de constituer 20 000 fiches de ménages. La fusion de ces données constitue le fichier central, correspondant à l’heure actuelle à un fichier des familles. Dans une étape ultérieure de la recherche, l’ordinateur rassemblera toutes les informations relatives à une même personne, créant ainsi un fichier des individus. Des données de toutes natures peuvent être intégrées automatiquement au fichier central, référant à des domaines aussi divers que l’épidémiologie, la génétique, l’éducation, la religion, la propriété foncière, la mobilité sociale, etc. Ces sous-fichiers étant jumelés au fichier central, les analyses non démographiques qui seront faites à partir de ce registre pourront bénéficier d’un éventail de données susceptibles de les enrichir substantiellement. Par ailleurs, ces fichiers sectoriels demeureront intégrés au fichier central permettant d’édifier à moyen terme un registre extrêmement riche, entièrement informatisé et authentiquement interdisciplinaire.
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame machine prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.
Distilled classifier scores by category (both heads)
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.002 | 0.003 |
| Meta-epidemiology (narrow) | 0.000 | 0.000 |
| Meta-epidemiology (broad) | 0.000 | 0.000 |
| Bibliometrics | 0.002 | 0.004 |
| Science and technology studies | 0.005 | 0.003 |
| Scholarly communication | 0.003 | 0.002 |
| Open science | 0.001 | 0.002 |
| Research integrity | 0.001 | 0.001 |
| Insufficient payload (model declined to judge) | 0.009 | 0.001 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".