MétaCan
Menu
Retour à la cohorte
Enregistrement W7161797297 · doi:10.82308/10902

Development of a knowledge graph for the Canadian milk-recording industry

2022· dissertation· en· W7161797297 sur OpenAlexaboutno aff
Junsheng Zhu

Notice bibliographique

Revuenon disponible
Typedissertation
Langueen
DomaineAgricultural and Biological Sciences
ThématiqueFood Supply Chain Traceability
Établissements canadiensnon disponible
Organismes subventionnairesnon disponible
Mots-clésKnowledge graphSubject (documents)

Résumé

récupéré en direct d'OpenAlex

Étant donné la diversité des processus de gestion dans de nombreux domaines agricoles, les techniques d'apprentissage automatique et la théorie des graphes de connaissances ont été explorées en vue de créer un système d'aide à la décision capable de fournir aux producteurs et à leurs conseillers des conseils et des réponses à partir de la littérature du domaine. La gestion des vaches en transition a été examinée en tant que preuve de concept.En termes d'extraction d'entités, un modèle neuronal Bi-LSTM a été formé pour cette tâche. L'ensemble de données comprenait 1152 phrases provenant de 20 articles. Ces phrases ont été divisées avec un pourcentage de 8:2, créant ainsi un ensemble de données d'entraînement de 922 phrases et un ensemble de données de test de 230 phrases. Les types d'entités étaient les maladies et la nutrition, étiquetées au format BIO (Begin, In, et Out des mots de l'entité). Trois méthodes ont été appliquées pour affiner le modèle de NER, à savoir l'augmentation du volume de données, l'ajustement des hyperparamètres et les techniques de PNL telles que l'intégration globale des vecteurs. Pendant la formation, l'augmentation des données de formation de 461 à 922 phrases, la couche LSTM bidirectionnelle avec 64 unités et l'emploi du vecteur global ont donné le meilleur résultat avec un score F1 global de 80 %. Le réseau neuronal BERT (Bidirectional Encoder Representations from Transformers) a été utilisé comme modèle d'extraction de relations. Plus précisément, il s'agit d'affiner le BERT en tant que classificateur multiclasse. Les phrases contenant deux entités ou plus prédites par le NER ont été utilisées pour entraîner le modèle d'extraction de relations. Les résultats n'ont pas été jugés satisfaisants, avec un score F1 global de 23 %, et la tâche d'extraction de relations a donc utilisé la prédiction d'un autre modèle neuronal d'extraction de relations entraîné avec Few-Rel. Après avoir introduit les données d'origine dans le modèle d'extraction d'entités et le modèle d'extraction de relations, un graphe de connaissances de 1 576 nœuds et 3 456 arêtes a été construit. Ces éléments ont été stockés dans une base de données de graphes Neo4j. Ensuite, la méthode Semantic Parsing a été utilisée pour mettre directement en correspondance la question naturelle avec la requête du graphe de connaissances. Cinq modèles de questions et règles de mise en correspondance ont été définis, et l'expression régulière a été utilisée pour fournir plus de flexibilité. En outre, pour déterminer la qualité des réponses que la connaissance construite à partir des articles, cinq réponses ont été évaluées sur la base d'un jugement humain. Les réponses ont été notées de 1 à 10 avec quatre métriques, à savoir la précision, le rappel, la granularité et l'utilité. Les scores globaux des cinq questions sur quatre métriques étaient respectivement de 7, 7.5, 7, 8 et 7. Cette étude a démontré comment extraire des connaissances à partir d'articles universitaires. Les réponses renvoyées par le graphe de connaissances impliquaient qu'il avait déjà une certaine compréhension de la gestion des vaches en transition. À l'avenir, d'autres ressources telles que des pages Web, des enregistrements de gestion à la ferme ou des connaissances d'experts pourraient être intégrées au graphe de connaissances afin de fournir des réponses plus précises

Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.

Comment cette classification a été obtenuedéplier

Prédiction distillée sur la base complète

Imitation des enseignants

Ni prévalence calibrée, ni vérité terrain. Validation humaine à venir. Apprise à partir de 10 348 étiquettes directes de Codex et de 10 348 étiquettes directes de Gemma. Le mode candidate est l'union des têtes enseignantes seuillées; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont ni des étiquettes humaines ni des étiquettes directes de modèles de pointe.

score de la tête « metaresearch » (Codex)0,000
score de la tête « metaresearch » (Gemma)0,000
Version: codex-gemma-dda1882f352aStatut de validation: machine_predicted_unvalidated
Catégories candidatesCharge utile insuffisante (le modèle a refusé de juger)
Catégories consensuellesaucune
DomaineSignal candidat: aucune · Signal consensuel: aucune
Devis d'étudeSignal candidat: Autre devis · Signal consensuel: aucune
GenreSignal candidat: Empirique · Signal consensuel: Empirique
Score de désaccord entre enseignants0,949
Score d'incertitude au seuil0,998

Scores Codex et Gemma par catégorie

CatégorieCodexGemma
Métarecherche0,0000,000
Méta-épidémiologie (sens strict)0,0000,000
Méta-épidémiologie (sens large)0,0000,000
Bibliométrie0,0000,000
Études des sciences et des technologies0,0010,000
Communication savante0,0000,000
Science ouverte0,0000,000
Intégrité de la recherche0,0000,000
Charge utile insuffisante (le modèle a refusé de juger)0,0030,000

Scores machine (provisoires)

Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.

Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.

Tête enseignante Opus0,038
Tête enseignante GPT0,270
Écart entre enseignants0,232 · la distance entre les deux têtes enseignantes sur ce seul travail
Statut de validationscore_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découle

Classification

machine, non validée

Prédiction automatique; un appel candidat d’une seule tête enseignante, pas un consensus.

Devis d'étudeAutre devis
Domainenon disponible
GenreEmpirique

Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».

En bref

Citations0
Publié2022
Routes d'admission1
Résumé présentoui

Explorer davantage

Même sujetFood Supply Chain TraceabilityTravaux en français237 207