MétaCan
Menu
Retour à la cohorte
Enregistrement W4285128742 · doi:10.18653/v1/2022.computel-1

Proceedings of the Fifth Workshop on the Use of Computational Methods in the Study of Endangered Languages

2022· paratext· en· W4285128742 sur OpenAlexaff
Sarah Moeller, Antonios Anastasopoulos, Aditi Chaudhary, Atticus Harrigan, Alexis Palmer, Alexandre Arkhipov, Alexis Michaud, Anna Kazantseva, Borini Lahiri, Christopher Cox, Claire Bowern, Daan van Esch, Dorothee Beermann, Elizabeth Salesky, Emily M. Bender, Emily Prud’hommeaux, Francis M. Tyers, František Kratochvíl, Gary Simons, Jean Maillard, Facebook Ai, Jeffrey Good, Judith L. Klavans, Luke Gessler, Martin Benjamin, Olga Lovick, Paul Trilsbeek, Richard Sproat, Ritesh Kumar, Robert Forkel, Sonal Sinha, Steven Bird, Ivan Ubaleht, Taisto-Kalevi Raudalainen, Bill Dyer, Roberto Zariquiey, Arturo Oncevay, Javier Enrique Díaz Vera, Gina‐Anne Levow, Patrick Lit- Tell, Kristen Howell, Manuel Mager, Abteen Ebrahimi, John E. Ortega, Annette Rios, Angela Fan, Xi- Mena Gutierrez-Vasques, Luis Chiruzzo, Gustavo A. Giménez-Lugo, Ricardo Ramos, Vladimir Ivan, Meza Ruiz, Rolando Coto‐Solano, Arya D. McCarthy, Christo Kirov, Matteo Grella, Amrit Nidhi, Patrick Xia, Kyle Gorman, Ekate- Rina Vylomova, Sabrina J. Mielke, Miikka Silfverberg, Timofey Arkhangelskiy, Na- Taly Krizhanovsky, Andrew Krizhanovsky, Elena Klyachko, Alexey Sorokin, John Mansfield, Valts Ernštreits, Yuval Pinter, Cassandra L. Jacobs, Ryan Cotterell, Mans Hulden, Wilhelmina Nekoto, Vukosi Marivate, Tshinondiwa Matsila, Timi Fasubaa, Taiwo Fagbohungbe, Solomon Oluwole Akinola, Shamsuddeen Muham- Mad, Salomon Kabongo Kabenamualu, Salomey Osei, Freshia Sackey, Rubungo Andre Niyongabo, Ricky Macharm, Perez Ogayo, Orevaoghene Ahia, Meressa Berhe, Mofetoluwa Adeyemi, Masabata Mokgesi-Selinga, Lawrence Okegbemi, Laura Martinus, Kolawole Tajudeen, Kevin Degila, Kelechi Ogueji, Kathleen Siminyu, Julia Kreutzer, Jason Webster, Tayyaba Nusrat Ali, Jade Abbott, Iroro Orife, Ignatius Ezeani, Idris Abdulkadir Dangana, Herman Kamper, Hady Elsahar, Good- Ness Duru, Ghollah Kioko, Murhabazi Espoir, Elan van Biljon, Daniel Whitenack, Tiago Pimentel, Maria Ryskina, Shijie Wu, Eleanor Chodroff, Brian Leonard, Gar- Rett Nicolai, Yustinus Ghanggo Ate, Khal- Ifa Salam, Nizar Habash, Charbel El-Khaissi, Omer Gold- Man, Michael Gasser, W.A. Lane, Matt Coler, Jaime Rafael, Montoya Samame, Gema Celeste, Silva Villegas, David Guriel, Jean- Philippe Bernardy, Andrey Shcherbakov, Аziyana V. Bayyr-ool, Karina Sheifer, Sofya Ganieva, Matvey Plugaryov, Ali Salehi, Natalia Krizhanovsky, Clara Va- Nia, Sardana Ivanova, Aelita Salchak, Christo- Pher Straughn, Zoey Liu, Jonathan North, Duygu Ataman, Witold Kieraś, Marcin Woliński, Totok Suhardijanto, Niklas Stoehr, Zahroh Nuriah, Shyam Ratan, Edoardo Maria Ponti, Grant Aiton, Richard Hatcher, Botond Barta, Dorina Lakatos, Gábor Szolnok, Farhan Samir

Notice bibliographique

Revuenon disponible
Typeparatext
Langueen
DomaineComputer Science
ThématiqueNatural Language Processing Techniques
Établissements canadiensCarleton UniversityFirst Nations University of CanadaUniversity of SaskatchewanUniversity of AlbertaNational Research Council CanadaUniversity of British Columbia
Organismes subventionnairesConsejo Nacional de Ciencia, Tecnología e Innovación Tecnológica
Mots-clésEndangered speciesComputer scienceProgramming languageEcologyBiology

Résumé

récupéré en direct d'OpenAlex

In this paper we present the speech corpus for the Siberian Ingrian Finnish language. The speech corpus includes: audio data, annotations, software tools for data processing, two databases and a web application. We have published part of the audio data and annotations. The software tool for parsing annotation files and feeding a relational database is developed and published under a free license. A web application is developed and available. At this moment, about 300 words and 200 phrases can be displayed using this web application.

Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.

Comment cette classification a été obtenuedéplier

Prédiction machine sur la base complète

Imitation des enseignants

Ni prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.

score de la tête « metaresearch » (Codex)0,015
score de la tête « metaresearch » (Gemma)0,017
Version: metacan-v3-hybrid-931329e0061cStatut de validation: machine_predicted_unvalidated
Catégories candidatesaucune
Catégories consensuellesaucune
DomaineSignal candidat: aucune · Signal consensuel: aucune
Devis d'étudeSignal candidat: Sans objet · Signal consensuel: aucune
GenreSignal candidat: Autre · Signal consensuel: aucune
Score de désaccord entre enseignants0,021
Score d'incertitude au seuil0,078

Scores du classifieur distillé par catégorie (deux têtes)

CatégorieCodexGemma
Métarecherche0,0150,017
Méta-épidémiologie (sens strict)0,0010,001
Méta-épidémiologie (sens large)0,0010,001
Bibliométrie0,0030,002
Études des sciences et des technologies0,0010,003
Communication savante0,0080,005
Science ouverte0,0030,005
Intégrité de la recherche0,0020,004
Charge utile insuffisante (le modèle a refusé de juger)0,0210,004

Scores machine (provisoires)

Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.

Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.

Tête enseignante Opus0,077
Tête enseignante GPT0,384
Écart entre enseignants0,307 · la distance entre les deux têtes enseignantes sur ce seul travail
Statut de validationscore_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découle

Classification

machine, non validée

Prédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.

Les modèles n’ont appliqué aucune catégorie : rien dans la taxonomie ne correspondait à ce travail.
Devis d'étudeSans objet
Domainenon disponible
GenreAutre

Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».

En bref

Citations6
Publié2022
Routes d'admission1
Résumé présentoui

Explorer davantage

Même sujetNatural Language Processing TechniquesTravaux en français237 207