Projet CORREZ : édition numérique des lettres internationales multilingues adressées à Emile Zola (2017-2020)
Bibliographic record
Abstract
Débuté en 2017, le projet « Naturalismes du monde » a été une initiative de partenariat incluant le CNRS, l’ENS et le Collège de France, au sein de la COMUE PSL. Le Labex TransferS a envisagé d’étudier les circulations des textes, des modèles intellectuels et des objets culturels saisis dans le contact des langues. Dans ce cadre, et en lien avec « La République des Savoirs », le Centre Zola de l’ITEM a souhaité étudier et valoriser les lettres internationales adressées à Zola, dont une part est encore conservée dans les archives du Dr. Brigitte Émile-Zola, précieuse collaboratrice des projets archivistiques zoliens. Il s’agit du courrier des lecteurs du monde, dans le contexte d’une vie littéraire internationalisée à la fin du 19e siècle, à l’ère du cosmopolitisme, des colonies et des Alliances françaises, du commerce industriel et des grands chantiers, et bien sûr au moment de l’affaire Dreyfus. Plus de 2400 lettres numérisées à ce jour sont en ligne sur cette plateforme d’édition numérique. Tous les continents sont couverts, sur une période qui va surtout des années 1880 jusqu’à la fin de la vie de l’écrivain : l’Europe limitrophe de la France (Belgique, Suisse, Allemagne, Espagne, Angleterre…), l’Europe de l’Est (Hongrie, Pologne, et les lettres de Russie…), les deux Amériques, du Nord et du Sud (Canada, États-Unis, Chili, Argentine, Brésil, Colombie, Costa Rica, Mexique ou encore Venezuela), le continent asiatique, (Inde et Indonésie), l’Australie, l’Afrique du Sud. L’équipe est loin d’avoir fait le tour de ce courrier international, dont une grande partie reste encore inédite. Cependant, le corpus déjà constitué permet d’élaborer une méthode et des axes de lecture qui répondent à la question principale d’un tel projet : quel traitement apporté à une telle masse épistolaire, pour quels intérêts et quels usages ? Le colloque de mai 2019, dont les actes sont publiés dans le numéro 94 des Cahiers naturalistes (2020), a tenté de répondre en partie à ces questions.
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame machine prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.
Distilled classifier scores by category (both heads)
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.004 | 0.006 |
| Meta-epidemiology (narrow) | 0.001 | 0.001 |
| Meta-epidemiology (broad) | 0.001 | 0.001 |
| Bibliometrics | 0.006 | 0.005 |
| Science and technology studies | 0.002 | 0.001 |
| Scholarly communication | 0.008 | 0.003 |
| Open science | 0.001 | 0.004 |
| Research integrity | 0.001 | 0.002 |
| Insufficient payload (model declined to judge) | 0.091 | 0.046 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".