Optimisation du rapport coûts-avantages dans la réalisation de dictionnaires terminologiques informatisés (DTI) sur PC
Bibliographic record
Abstract
Les dictionnaires terminologiques informatisés d'aujourd'hui répondent à la plupart des exigences qu'on pouvait formuler vers la fin des années 1980: rapidité d'exécution, consultation multiniveau, etc. Ce progrès, dans certains cas, n'a pas été tant le fait d'une sophistication accrue de l'ingénierie linguistique que de l'avènement de Windows 3.x. Cependant, l'élaboration du dictionnaire informatisé continue de comporter une phase de collecte et de description de données et une phase de développement de moteur de pilotage et d'interrogation du dictionnaire. Cela a pour conséquence non seulement de détourner l'attention du terminologue du contenu de son dictionnaire au profit du support-véhicule mais aussi d'augmenter le coût des dictionnaires. Or, on sait que le moteur du système d'aide de Windows est assez puissant pour piloter n'importe quel dictionnaire terminologique. Il présente par ailleurs d'autres avantages qui le rendent idéal pour la tâche : il est d'une conception hypertexte et il est multi- et hypermedia. L'urgence de la recherche d'un format standard de codage facilitant l'échange de données terminologiques est aussi un argument de poids en faveur de l'adoption de ce système : quel que soit l'outil de création utilisé pour créer un fichier de WinHelp, celui-ci a toujours le format RTF sous-jacent. A priori, c'est un projet qui semble relever avant tout du génie logiciel mais il n'en est rien puisqu'il permet de poser des questions proprement terminologiques et termino-graphiques, notamment celles du statut et de la gestion de la synonymie en terminologie, de la lisibilité de la fiche terminologique, de l'élargissement de la fonction terminologique. Nous espérons enfin qu'il permettra de mettre en œuvre ce qu'on pourrait appeler le "test hypertexte de terminologisme" permettant la validation a posteriori du statut terminologique des unités proposées comme telles par le terminologue.
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame distilled prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. Learned from the 10,348 direct Codex labels and 10,348 direct Gemma labels. Candidate is the union of thresholded teacher heads; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels or direct frontier model labels.
Codex and Gemma teacher scores by category
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.001 | 0.001 |
| Meta-epidemiology (narrow) | 0.000 | 0.000 |
| Meta-epidemiology (broad) | 0.001 | 0.000 |
| Bibliometrics | 0.000 | 0.000 |
| Science and technology studies | 0.002 | 0.002 |
| Scholarly communication | 0.001 | 0.001 |
| Open science | 0.000 | 0.000 |
| Research integrity | 0.000 | 0.001 |
| Insufficient payload (model declined to judge) | 0.001 | 0.000 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one teacher head, not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".