MétaCan
Menu
Back to cohort
Record W7161797297 · doi:10.82308/10902

Development of a knowledge graph for the Canadian milk-recording industry

2022· dissertation· en· W7161797297 on OpenAlexaboutno aff
Junsheng Zhu

Bibliographic record

Venuenot available
Typedissertation
Languageen
FieldAgricultural and Biological Sciences
TopicFood Supply Chain Traceability
Canadian institutionsnot available
Fundersnot available
KeywordsKnowledge graphSubject (documents)

Abstract

fetched live from OpenAlex

Étant donné la diversité des processus de gestion dans de nombreux domaines agricoles, les techniques d'apprentissage automatique et la théorie des graphes de connaissances ont été explorées en vue de créer un système d'aide à la décision capable de fournir aux producteurs et à leurs conseillers des conseils et des réponses à partir de la littérature du domaine. La gestion des vaches en transition a été examinée en tant que preuve de concept.En termes d'extraction d'entités, un modèle neuronal Bi-LSTM a été formé pour cette tâche. L'ensemble de données comprenait 1152 phrases provenant de 20 articles. Ces phrases ont été divisées avec un pourcentage de 8:2, créant ainsi un ensemble de données d'entraînement de 922 phrases et un ensemble de données de test de 230 phrases. Les types d'entités étaient les maladies et la nutrition, étiquetées au format BIO (Begin, In, et Out des mots de l'entité). Trois méthodes ont été appliquées pour affiner le modèle de NER, à savoir l'augmentation du volume de données, l'ajustement des hyperparamètres et les techniques de PNL telles que l'intégration globale des vecteurs. Pendant la formation, l'augmentation des données de formation de 461 à 922 phrases, la couche LSTM bidirectionnelle avec 64 unités et l'emploi du vecteur global ont donné le meilleur résultat avec un score F1 global de 80 %. Le réseau neuronal BERT (Bidirectional Encoder Representations from Transformers) a été utilisé comme modèle d'extraction de relations. Plus précisément, il s'agit d'affiner le BERT en tant que classificateur multiclasse. Les phrases contenant deux entités ou plus prédites par le NER ont été utilisées pour entraîner le modèle d'extraction de relations. Les résultats n'ont pas été jugés satisfaisants, avec un score F1 global de 23 %, et la tâche d'extraction de relations a donc utilisé la prédiction d'un autre modèle neuronal d'extraction de relations entraîné avec Few-Rel. Après avoir introduit les données d'origine dans le modèle d'extraction d'entités et le modèle d'extraction de relations, un graphe de connaissances de 1 576 nœuds et 3 456 arêtes a été construit. Ces éléments ont été stockés dans une base de données de graphes Neo4j. Ensuite, la méthode Semantic Parsing a été utilisée pour mettre directement en correspondance la question naturelle avec la requête du graphe de connaissances. Cinq modèles de questions et règles de mise en correspondance ont été définis, et l'expression régulière a été utilisée pour fournir plus de flexibilité. En outre, pour déterminer la qualité des réponses que la connaissance construite à partir des articles, cinq réponses ont été évaluées sur la base d'un jugement humain. Les réponses ont été notées de 1 à 10 avec quatre métriques, à savoir la précision, le rappel, la granularité et l'utilité. Les scores globaux des cinq questions sur quatre métriques étaient respectivement de 7, 7.5, 7, 8 et 7. Cette étude a démontré comment extraire des connaissances à partir d'articles universitaires. Les réponses renvoyées par le graphe de connaissances impliquaient qu'il avait déjà une certaine compréhension de la gestion des vaches en transition. À l'avenir, d'autres ressources telles que des pages Web, des enregistrements de gestion à la ferme ou des connaissances d'experts pourraient être intégrées au graphe de connaissances afin de fournir des réponses plus précises

Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.

How this classification was reachedexpand

Full frame distilled prediction

Teacher imitation

Not calibrated prevalence, not ground truth. Human validation pending. Learned from the 10,348 direct Codex labels and 10,348 direct Gemma labels. Candidate is the union of thresholded teacher heads; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels or direct frontier model labels.

metaresearch head score (Codex)0.000
metaresearch head score (Gemma)0.000
Version: codex-gemma-dda1882f352aValidation status: machine_predicted_unvalidated
Candidate categoriesInsufficient payload (model declined to judge)
Consensus categoriesnone
DomainCandidate signal: none · Consensus signal: none
Study designCandidate signal: Other design · Consensus signal: none
GenreCandidate signal: Empirical · Consensus signal: Empirical
Teacher disagreement score0.949
Threshold uncertainty score0.998

Codex and Gemma teacher scores by category

CategoryCodexGemma
Metaresearch0.0000.000
Meta-epidemiology (narrow)0.0000.000
Meta-epidemiology (broad)0.0000.000
Bibliometrics0.0000.000
Science and technology studies0.0010.000
Scholarly communication0.0000.000
Open science0.0000.000
Research integrity0.0000.000
Insufficient payload (model declined to judge)0.0030.000

Machine scores (provisional)

The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.

Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.

Opus teacher head0.038
GPT teacher head0.270
Teacher spread0.232 · how far apart the two teachers sit on this one work
Validation statusscore_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from it

Classification

machine, unvalidated

Machine predicted; a candidate call from one teacher head, not a consensus.

Study designOther design
Domainnot available
GenreEmpirical

How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".

Quick stats

Citations0
Published2022
Admission routes1
Has abstractyes

Explore more

Same topicFood Supply Chain TraceabilityFrench-language works237,207