Notice bibliographique
Résumé
Les premieres recherches en traduction automatique ont debute en URSS en 1954 a la suite de la premiere demonstration sur calculatrice electronique qui a lieu en janvier 1954 a New York. L'idee d'associer l'informatique et la traduction est donc nee des l'apparition de l'ordinateur, qui n'etait au debut qu'une machine a calculer. La traduction automatique a la plus longue histoire de toutes les branches du traitement du langage humain. Mais apres un demi-siecle de travaux dans ce domaine, la traduction automatique au sens strict, c'est-a-dire traduction entierement automatisee offrant des textes traduits de qualite parfaite, semble relever encore de l'utopie. Pour donner une idee du probleme, il suffit de citer SYSTRAN et TAUM-METEO, sans doute les meilleurs exemples de systemes de traduction automatique existants en utilisation effective. SYSTRAN est un systeme pafaitement automatise, sans limitation de domaine d'application ni de type de texte. Mais son principal interet reside dans la rapidite de traduction, ce qui compense la faiblesse qualitative des textes traduits. Concernant TAUM-METEO, systeme canadien destine a la traduction de la meteorologie, il donne des traductions de bonne qualite par un processus entierement automatique. Ses performances qualitatives et fonctionnelles sont dues a la double limitation : le domaine d'application tres specifique et restreint et le type de textes exceptionnellement particulier, impliquant un vocabulaire reduit et une syntaxe figee autour d'un petit nombre de structures. Cependant, l'extension du syteme a d'autres domaines s'avere difficile. La traduction automatique est un domaine extremement complexe. On sait dans l'etat actuel des connaissances et des techniques que l'objectif initial etait trop ambitieux. Mais on sait egalement quand la traduction automatique peut rendre de reels services. La mise en oeuvre d'un systeme de traduction operationnel necessite beaucoup de modestie et de realisme dans la demarche. Toutes ces reflexions nous ont amenee a penser que seuls la distinction des domaines et des types de textes et une certaine interaction entre l'homme et la machine permettraient d'aboutir a un systeme de traduction reellement utilisable et offrant des resultats satisfaisants. C'est pourquoi nous avons entrepris de developper une methodologie de traduction automatique ayant recours a la specification du type de texte traite et a l'intervention humaine en vue de l'application au couple coreen-francais. Plus concretement, le type de texte que nous avons choisi concerne les phrases injonctives, c'est-a-dire phrases du type 'notices d'utilisation' ou 'instructions' comme les recettes de cuisine. Pour ce qui est de l'intervention humaine, c'est une strategie retenue pour la desambiguisation syntaxique. Par une large interaction homme-machine au niveau syntaxique, nous avons pu maximiser l'automatisation de la desambiguisation semantique, ce qui a contribue a ameliorer considerablement la qualite des traductions produites. Cet article a pour but de presenter, au plan syntaxique, les grandes lignes de la demarche methodologique adoptee et les strategies traductionnelles developpees dans notre travail. Faute de pouvoir exposer en detail dans ce bref article tous les problemes rencontres dans notre travail, avec les methodes utilisees pour leur resolution, nous nous concentrerons sur la representation et le traitement des informations syntaxiques. Ici, tout propos semantique est donc deliberement et necessairement abrege. Les problemes poses et traites au plan semantique seront exposes dans un deuxieme article qui est en preparation et qui fera suite a celui-ci. Dans la partie introductoire du present article, nous evoquerons les limites des systemes de traduction automatique existants et esquissons l'orientation methodologique choisie dans notre travail pour surmonter les limites evoquees. Dans la partie qui suit, nous exposerons les phenomenes et problemes syntaxiques etudies dans notre travail ainsi que les methodes appliquees pour leur representation et leur traitement. Les propos qui y seront abordes portent sur les points suivants : la representation formelle des structures de phrase, la formalisation des informations syntaxiques pour les dictionnaires internes et le module de transfert, l'ambiguite syntaxique et la polysemie des verbes, le figement, le marquage de la coordination interproposionnelle, la restitution de l'anaphorique zero. Enfin, avant de conclure, nous presenterons le systeme de traduction realise a titre experimental par l'implementation informatique de notre formalisme. Nous decrirons sommairement l'architecture et le fonctionnement du systeme pour montrer comment les conceptions theoriques se materialisent.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction machine sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.
Scores du classifieur distillé par catégorie (deux têtes)
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,002 | 0,005 |
| Méta-épidémiologie (sens strict) | 0,001 | 0,001 |
| Méta-épidémiologie (sens large) | 0,001 | 0,001 |
| Bibliométrie | 0,002 | 0,003 |
| Études des sciences et des technologies | 0,002 | 0,002 |
| Communication savante | 0,005 | 0,005 |
| Science ouverte | 0,001 | 0,002 |
| Intégrité de la recherche | 0,002 | 0,002 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,036 | 0,023 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».