MétaCan
Menu
Retour à la cohorte
Enregistrement W7134606798

深い意味処理のための統合日本語コーパスの開発と言語研究

2017· other· en· W7134606798 sur OpenAlexaboutno aff
キョウコ オハラ, Kyoko Ohara, 京子 小原

Notice bibliographique

RevueKeiO Associated Repository of Academic Resources (Keio University) · 2017
Typeother
Langueen
Domaine
Thématique
Établissements canadiensnon disponible
Organismes subventionnairesnon disponible
Mots-clésFrameNetSemantic role labelingAnnotationParsingNatural languageResource (disambiguation)Frame (networking)Principal (computer security)
DOInon disponible

Résumé

récupéré en direct d'OpenAlex

本研究の究極的な目的は, 研究代表者が構築した認知言語学に基づく詳細な意味情報を付与した言語資源「日本語フレームネット」(JFN)を, 言語研究のみならず自然言語処理にとってもこれまで以上に有益な言語資源とする方策を検討することである。そのためには, JFNの規模を大きくさせることと, JFNの持つ豊富な意味情報に加え統語情報をも含める, という2つの方向性が考えられる。本研究では特に, 国立国語研究所で構築中のNINJAL Parsed Corpus of Modern Japanese (NPCMJ)とリンクさせることを検討した。NPCMJは文の統語情報のみで意味情報は含まないが規模は大きいのに対JFNは詳細な意味情報を含むが規模が小さく, 両者を統合することで深い意味処理を行う自然言語処理アプリケーションのための言語資源とすることができると考えたからである。 当初計画したJFNとNPCMJのリンク方法は2つあった。一つ目は, JFNで意味情報付与の際の入力データとしてNPCMJの統語情報付きデータを用いることである。二つ目は, JFNとNPCMJを統合させ, 認知科学的にも妥当な詳細な意味情報と文の統語情報の両方を含んだコーパスとすることである。前者に関しては, ツールを開発した。後者については実現までの目処がたった。 本研究の経過・成果は, 国際認知言語学会, マルチリンガルフレームネット会議, 言語処理学会第24回年次大会にて発表した。 本研究によりNPCMJとJFNの統合は実現可能であることが明らかとなった。今後はJFNを深い意味処理を行う自然言語処理アプリケーションにとってさらに有益な資源とするため, より規模の大きく自然言語処理分野で定評のある言語資源とのリンクを検討したい。 The principal investigator (PI) of this research project has been developing Japanese FrameNet (JFN), a language resource that contains rich semantic information which is based on the theory of Frame Semantics. The ultimate goal of this research project is to enable JFN to be useful for natural language processing (NLP) applications, especially for those that involve deep semantic processing. In order to achieve this goal, there are two directions. One is to make the size of JFN larger. The other is to add syntactic information to JFN, in addition to the existing semantic information. This research project pursued the latter approach and focused on ways to link the JFN data with the NINJAL (National Institute for Japanese Language and Linguistics) Parsed Corpus of Modern Japanese (NPCMJ). NPCMJ does not contain semantic information at all but includes detailed syntactic information of sentences and its size is larger than that of JFN. Therefore, it was expected that the combined language resource would be useful for various NLP applications. There are two ways to link the JFN data with that of NPCMJ. One is to use the NPCMJ data as input to the JFN annotation (tagging) process. The other is to integrate JFN and NPCMJ to build a combined corpus. As for the former, a tool was implemented to allow the NPCMJ data as input to the JFN annotation process. As for the latter, how to combine the two resources was investigated. The accomplishments of the project were presented at ICLC14 (Tartu, Estonia ; July 2017), the Multilingual FrameNet meeting (Vancouver, Canada ; Aug. 2017), and NLP2018 (Okayama, Mar. 2018). Through this research project, we were able to confirm that NPCMJ and JFN can be combined. Future plans include attempting to link JFN with a language resource which is more suitable for semantic-processing NLP applications and which is larger than NPCMJ.

Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.

Comment cette classification a été obtenuedéplier

Prédiction distillée sur la base complète

Imitation des enseignants

Ni prévalence calibrée, ni vérité terrain. Validation humaine à venir. Apprise à partir de 10 348 étiquettes directes de Codex et de 10 348 étiquettes directes de Gemma. Le mode candidate est l'union des têtes enseignantes seuillées; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont ni des étiquettes humaines ni des étiquettes directes de modèles de pointe.

score de la tête « metaresearch » (Codex)0,001
score de la tête « metaresearch » (Gemma)0,001
Version: codex-gemma-dda1882f352aStatut de validation: machine_predicted_unvalidated
Catégories candidatesMéta-épidémiologie (sens strict), Intégrité de la recherche
Catégories consensuellesIntégrité de la recherche
DomaineSignal candidat: aucune · Signal consensuel: aucune
Devis d'étudeSignal candidat: Sans objet · Signal consensuel: Sans objet
GenreSignal candidat: Autre · Signal consensuel: Autre
Score de désaccord entre enseignants0,013
Score d'incertitude au seuil0,999

Scores Codex et Gemma par catégorie

CatégorieCodexGemma
Métarecherche0,0010,001
Méta-épidémiologie (sens strict)0,0010,001
Méta-épidémiologie (sens large)0,0020,001
Bibliométrie0,0040,001
Études des sciences et des technologies0,0010,002
Communication savante0,0000,000
Science ouverte0,0050,001
Intégrité de la recherche0,0050,003
Charge utile insuffisante (le modèle a refusé de juger)0,0000,001

Scores machine (provisoires)

Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.

Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.

Tête enseignante Opus0,012
Tête enseignante GPT0,221
Écart entre enseignants0,208 · la distance entre les deux têtes enseignantes sur ce seul travail
Statut de validationscore_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découle

Classification

machine, non validée

Prédiction automatique; les deux têtes enseignantes s’accordent sur ce qui est montré ici.

Devis d'étudeSans objet
Domainenon disponible
GenreAutre

Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».

En bref

Citations0
Publié2017
Routes d'admission1
Résumé présentoui

Explorer davantage

Même revueKeiO Associated Repository of Academic Resources (Keio University)Travaux en français237 207