MétaCan
Menu
Back to cohort
Record W7067280372

The Lemmatisation of Old English Weak Verbs on a Relational Database

2019· other· es· W7067280372 on OpenAlexaboutno aff

Bibliographic record

VenueRIUR (Universidad de La Rioja) · 2019
Typeother
Languagees
FieldEconomics, Econometrics and Finance
TopicDiverse Scientific and Economic Studies
Canadian institutionsnot available
Fundersnot available
KeywordsLexicographyCorpus linguisticsPrincipal (computer security)Old English
DOInot available

Abstract

fetched live from OpenAlex

Resumen en castellano: Esta tesis trata de la morfología verbal del inglés antiguo para identificar y lematizar los verbos débiles de esta lengua en un corpus al que se accede a través de una base de datos léxica. La lematización es una de las tareas más importantes a la hora de construir un diccionario. Sin embargo, es una de las tareas pendientes en el campo de la lingüística histórica debido a que no existen corpora exhaustivos y lematizados de esta lengua. El enfoque de esta tesis doctoral está en la lematización de las tres clases de verbos débiles del inglés antiguo, aunque las áreas de la Lexicografía y la Lingüística de Corpus son también relevantes para esta investigación. Las fuentes principales de esta investigación son las formas flexivas que están atestiguadas en el Dictionary of Old English Corpus (DOEC) y que están disponibles en el lematizador Norna, las fuentes lexicográficas que existen publicadas sobre esta lengua, principalmente el Dictionary of Old English (DOE), y otras fuentes textuales como el York-Toronto-Helsinki Parsed Corpus of Old English (YCOE) y una indexación de fuentes secundarias del inglés antiguo. El objetivo principal supone la identificación de las flexiones de los verbos débiles y de su lematización con uno de los lemas propuestos en las listas de referencia. Conseguir este objetivo implica manejar las fuentes disponibles en inglés antiguo para poder lematizar y validar los resultados del análisis y el diseño de un método que combine búsquedas automáticas en la base de datos léxica Nerthus y la revisión manual de los resultados. La metodología incluye cuatro pasos sucesivos con diversas tareas en cada paso. El primero de estos pasos tiene como objetivo la lematización de las formas canónicas de los verbos débiles lanzando cadenas de búsquedas específicas para cada clase de verbos débiles en el lematizador Norna, donde está disponible un índice de tipos del DOEC, la fuente de información más fiable de la que se dispone en inglés antiguo. Después, los resultados se validan con el DOE y se añaden las formas no-canónicas de los verbos débiles entre las letras A y H. El tercer paso tiene como objetivo identificar las formas no-canónicas de las terminaciones flexivas y de las vocales de los radicales que aparecen con más frecuencia en los verbos débiles para generar patrones de lematización. La búsqueda de estos patrones y de la lista de prefijos no-canónicos que está disponible en Norna culmina en la lematización de las formas flexivas no transparentes de los verbos débiles. La validación de los resultados de las letras I a la Y supone el último paso de la metodología, donde se comparan los datos obtenidos con el análisis sintáctico del YCOE y con los datos que se obtienen de una base de datos de indexación de las fuentes secundarias del inglés antiguo. Los problemas que surgen a lo largo del proceso de lematización tienen que ver principalmente con las peculiaridades del inglés antiguo y las limitaciones de la lematización de tipos que esta investigación sigue. La discusión de los resultados del análisis concluye esta tesis. Las principales aportaciones de esta tesis son las listas de lemas y sus formas flexivas, especialmente las de los verbos entre las letras I y la Y ya que no están disponibles todavía, y el método que se ha diseñado para identificar estas formas, incluyendo los patrones de lematización generados para lematizar las formas con terminaciones no comunes y vocales no canónicas en el radical.

Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.

How this classification was reachedexpand

Full frame distilled prediction

Teacher imitation

Not calibrated prevalence, not ground truth. Human validation pending. Learned from the 10,348 direct Codex labels and 10,348 direct Gemma labels. Candidate is the union of thresholded teacher heads; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels or direct frontier model labels.

metaresearch head score (Codex)0.001
metaresearch head score (Gemma)0.000
Version: codex-gemma-dda1882f352aValidation status: machine_predicted_unvalidated
Candidate categoriesMeta-epidemiology (narrow), Insufficient payload (model declined to judge)
Consensus categoriesInsufficient payload (model declined to judge)
DomainCandidate signal: none · Consensus signal: none
Study designCandidate signal: Not applicable · Consensus signal: none
GenreCandidate signal: Other · Consensus signal: Other
Teacher disagreement score0.641
Threshold uncertainty score1.000

Codex and Gemma teacher scores by category

CategoryCodexGemma
Metaresearch0.0010.000
Meta-epidemiology (narrow)0.0000.000
Meta-epidemiology (broad)0.0010.000
Bibliometrics0.0000.000
Science and technology studies0.0000.000
Scholarly communication0.0000.000
Open science0.0010.000
Research integrity0.0000.000
Insufficient payload (model declined to judge)0.0080.014

Machine scores (provisional)

The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.

Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.

Opus teacher head0.019
GPT teacher head0.206
Teacher spread0.187 · how far apart the two teachers sit on this one work
Validation statusscore_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from it

Classification

machine, unvalidated

Machine predicted; both teacher heads agree on what is shown here.

Study designNot applicable
Domainnot available
GenreOther

How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".

Quick stats

Citations0
Published2019
Admission routes1
Has abstractyes

Explore more

Same venueRIUR (Universidad de La Rioja)Same topicDiverse Scientific and Economic StudiesFrench-language works237,207