Bibliographic record
Abstract
Les premieres recherches en traduction automatique ont debute en URSS en 1954 a la suite de la premiere demonstration sur calculatrice electronique qui a lieu en janvier 1954 a New York. L'idee d'associer l'informatique et la traduction est donc nee des l'apparition de l'ordinateur, qui n'etait au debut qu'une machine a calculer. La traduction automatique a la plus longue histoire de toutes les branches du traitement du langage humain. Mais apres un demi-siecle de travaux dans ce domaine, la traduction automatique au sens strict, c'est-a-dire traduction entierement automatisee offrant des textes traduits de qualite parfaite, semble relever encore de l'utopie. Pour donner une idee du probleme, il suffit de citer SYSTRAN et TAUM-METEO, sans doute les meilleurs exemples de systemes de traduction automatique existants en utilisation effective. SYSTRAN est un systeme pafaitement automatise, sans limitation de domaine d'application ni de type de texte. Mais son principal interet reside dans la rapidite de traduction, ce qui compense la faiblesse qualitative des textes traduits. Concernant TAUM-METEO, systeme canadien destine a la traduction de la meteorologie, il donne des traductions de bonne qualite par un processus entierement automatique. Ses performances qualitatives et fonctionnelles sont dues a la double limitation : le domaine d'application tres specifique et restreint et le type de textes exceptionnellement particulier, impliquant un vocabulaire reduit et une syntaxe figee autour d'un petit nombre de structures. Cependant, l'extension du syteme a d'autres domaines s'avere difficile. La traduction automatique est un domaine extremement complexe. On sait dans l'etat actuel des connaissances et des techniques que l'objectif initial etait trop ambitieux. Mais on sait egalement quand la traduction automatique peut rendre de reels services. La mise en oeuvre d'un systeme de traduction operationnel necessite beaucoup de modestie et de realisme dans la demarche. Toutes ces reflexions nous ont amenee a penser que seuls la distinction des domaines et des types de textes et une certaine interaction entre l'homme et la machine permettraient d'aboutir a un systeme de traduction reellement utilisable et offrant des resultats satisfaisants. C'est pourquoi nous avons entrepris de developper une methodologie de traduction automatique ayant recours a la specification du type de texte traite et a l'intervention humaine en vue de l'application au couple coreen-francais. Plus concretement, le type de texte que nous avons choisi concerne les phrases injonctives, c'est-a-dire phrases du type 'notices d'utilisation' ou 'instructions' comme les recettes de cuisine. Pour ce qui est de l'intervention humaine, c'est une strategie retenue pour la desambiguisation syntaxique. Par une large interaction homme-machine au niveau syntaxique, nous avons pu maximiser l'automatisation de la desambiguisation semantique, ce qui a contribue a ameliorer considerablement la qualite des traductions produites. Cet article a pour but de presenter, au plan syntaxique, les grandes lignes de la demarche methodologique adoptee et les strategies traductionnelles developpees dans notre travail. Faute de pouvoir exposer en detail dans ce bref article tous les problemes rencontres dans notre travail, avec les methodes utilisees pour leur resolution, nous nous concentrerons sur la representation et le traitement des informations syntaxiques. Ici, tout propos semantique est donc deliberement et necessairement abrege. Les problemes poses et traites au plan semantique seront exposes dans un deuxieme article qui est en preparation et qui fera suite a celui-ci. Dans la partie introductoire du present article, nous evoquerons les limites des systemes de traduction automatique existants et esquissons l'orientation methodologique choisie dans notre travail pour surmonter les limites evoquees. Dans la partie qui suit, nous exposerons les phenomenes et problemes syntaxiques etudies dans notre travail ainsi que les methodes appliquees pour leur representation et leur traitement. Les propos qui y seront abordes portent sur les points suivants : la representation formelle des structures de phrase, la formalisation des informations syntaxiques pour les dictionnaires internes et le module de transfert, l'ambiguite syntaxique et la polysemie des verbes, le figement, le marquage de la coordination interproposionnelle, la restitution de l'anaphorique zero. Enfin, avant de conclure, nous presenterons le systeme de traduction realise a titre experimental par l'implementation informatique de notre formalisme. Nous decrirons sommairement l'architecture et le fonctionnement du systeme pour montrer comment les conceptions theoriques se materialisent.
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame machine prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.
Distilled classifier scores by category (both heads)
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.002 | 0.005 |
| Meta-epidemiology (narrow) | 0.001 | 0.001 |
| Meta-epidemiology (broad) | 0.001 | 0.001 |
| Bibliometrics | 0.002 | 0.003 |
| Science and technology studies | 0.002 | 0.002 |
| Scholarly communication | 0.005 | 0.005 |
| Open science | 0.001 | 0.002 |
| Research integrity | 0.002 | 0.002 |
| Insufficient payload (model declined to judge) | 0.036 | 0.023 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".