MétaCan
Menu
Back to cohort
Record W2267175158

한-불 지령적 텍스트 번역시스템의 구현을 위한 방법론 연구(1)

2006· article· ko· W2267175158 on OpenAlexaboutno aff
홍미선

Bibliographic record

VenueEtudes de la Culture Francaise et de Arts en France · 2006
Typearticle
Languageko
FieldComputer Science
TopicSemantic Web and Ontologies
Canadian institutionsnot available
Fundersnot available
KeywordsHumanitiesPhilosophyArt
DOInot available

Abstract

fetched live from OpenAlex

Les premieres recherches en traduction automatique ont debute en URSS en 1954 a la suite de la premiere demonstration sur calculatrice electronique qui a lieu en janvier 1954 a New York. L'idee d'associer l'informatique et la traduction est donc nee des l'apparition de l'ordinateur, qui n'etait au debut qu'une machine a calculer. La traduction automatique a la plus longue histoire de toutes les branches du traitement du langage humain. Mais apres un demi-siecle de travaux dans ce domaine, la traduction automatique au sens strict, c'est-a-dire traduction entierement automatisee offrant des textes traduits de qualite parfaite, semble relever encore de l'utopie. Pour donner une idee du probleme, il suffit de citer SYSTRAN et TAUM-METEO, sans doute les meilleurs exemples de systemes de traduction automatique existants en utilisation effective. SYSTRAN est un systeme pafaitement automatise, sans limitation de domaine d'application ni de type de texte. Mais son principal interet reside dans la rapidite de traduction, ce qui compense la faiblesse qualitative des textes traduits. Concernant TAUM-METEO, systeme canadien destine a la traduction de la meteorologie, il donne des traductions de bonne qualite par un processus entierement automatique. Ses performances qualitatives et fonctionnelles sont dues a la double limitation : le domaine d'application tres specifique et restreint et le type de textes exceptionnellement particulier, impliquant un vocabulaire reduit et une syntaxe figee autour d'un petit nombre de structures. Cependant, l'extension du syteme a d'autres domaines s'avere difficile. La traduction automatique est un domaine extremement complexe. On sait dans l'etat actuel des connaissances et des techniques que l'objectif initial etait trop ambitieux. Mais on sait egalement quand la traduction automatique peut rendre de reels services. La mise en oeuvre d'un systeme de traduction operationnel necessite beaucoup de modestie et de realisme dans la demarche. Toutes ces reflexions nous ont amenee a penser que seuls la distinction des domaines et des types de textes et une certaine interaction entre l'homme et la machine permettraient d'aboutir a un systeme de traduction reellement utilisable et offrant des resultats satisfaisants. C'est pourquoi nous avons entrepris de developper une methodologie de traduction automatique ayant recours a la specification du type de texte traite et a l'intervention humaine en vue de l'application au couple coreen-francais. Plus concretement, le type de texte que nous avons choisi concerne les phrases injonctives, c'est-a-dire phrases du type 'notices d'utilisation' ou 'instructions' comme les recettes de cuisine. Pour ce qui est de l'intervention humaine, c'est une strategie retenue pour la desambiguisation syntaxique. Par une large interaction homme-machine au niveau syntaxique, nous avons pu maximiser l'automatisation de la desambiguisation semantique, ce qui a contribue a ameliorer considerablement la qualite des traductions produites. Cet article a pour but de presenter, au plan syntaxique, les grandes lignes de la demarche methodologique adoptee et les strategies traductionnelles developpees dans notre travail. Faute de pouvoir exposer en detail dans ce bref article tous les problemes rencontres dans notre travail, avec les methodes utilisees pour leur resolution, nous nous concentrerons sur la representation et le traitement des informations syntaxiques. Ici, tout propos semantique est donc deliberement et necessairement abrege. Les problemes poses et traites au plan semantique seront exposes dans un deuxieme article qui est en preparation et qui fera suite a celui-ci. Dans la partie introductoire du present article, nous evoquerons les limites des systemes de traduction automatique existants et esquissons l'orientation methodologique choisie dans notre travail pour surmonter les limites evoquees. Dans la partie qui suit, nous exposerons les phenomenes et problemes syntaxiques etudies dans notre travail ainsi que les methodes appliquees pour leur representation et leur traitement. Les propos qui y seront abordes portent sur les points suivants : la representation formelle des structures de phrase, la formalisation des informations syntaxiques pour les dictionnaires internes et le module de transfert, l'ambiguite syntaxique et la polysemie des verbes, le figement, le marquage de la coordination interproposionnelle, la restitution de l'anaphorique zero. Enfin, avant de conclure, nous presenterons le systeme de traduction realise a titre experimental par l'implementation informatique de notre formalisme. Nous decrirons sommairement l'architecture et le fonctionnement du systeme pour montrer comment les conceptions theoriques se materialisent.

Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.

How this classification was reachedexpand

Full frame machine prediction

Teacher imitation

Not calibrated prevalence, not ground truth. Human validation pending. The Gemma side is a direct model label for every work in the frame, read from the title-only record. The Codex side is a classifier learned from the 10,348 direct Codex labels and calibrated to design-weighted sample rates; fields without enough sample support carry no Codex call. Candidate is the union of the two sides; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels.

metaresearch head score (Codex)0.002
metaresearch head score (Gemma)0.005
Version: metacan-v3-hybrid-931329e0061cValidation status: machine_predicted_unvalidated
Candidate categoriesnone
Consensus categoriesnone
DomainCandidate signal: none · Consensus signal: none
Study designCandidate signal: Theoretical or conceptual · Consensus signal: none
GenreCandidate signal: Methods · Consensus signal: Methods
Teacher disagreement score0.036
Threshold uncertainty score0.120

Distilled classifier scores by category (both heads)

CategoryCodexGemma
Metaresearch0.0020.005
Meta-epidemiology (narrow)0.0010.001
Meta-epidemiology (broad)0.0010.001
Bibliometrics0.0020.003
Science and technology studies0.0020.002
Scholarly communication0.0050.005
Open science0.0010.002
Research integrity0.0020.002
Insufficient payload (model declined to judge)0.0360.023

Machine scores (provisional)

The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.

Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.

Opus teacher head0.006
GPT teacher head0.265
Teacher spread0.259 · how far apart the two teachers sit on this one work
Validation statusscore_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from it

Classification

machine, unvalidated

Machine predicted; a candidate call from one source (direct Gemma or distilled Codex), not a consensus.

The models applied no category: nothing in the taxonomy fit this work.
Study designTheoretical or conceptual
Domainnot available
GenreMethods

How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".

Quick stats

Citations0
Published2006
Admission routes1
Has abstractyes

Explore more

Same venueEtudes de la Culture Francaise et de Arts en FranceSame topicSemantic Web and OntologiesFrench-language works237,207