Development of a knowledge graph for the Canadian milk-recording industry
Bibliographic record
Abstract
Étant donné la diversité des processus de gestion dans de nombreux domaines agricoles, les techniques d'apprentissage automatique et la théorie des graphes de connaissances ont été explorées en vue de créer un système d'aide à la décision capable de fournir aux producteurs et à leurs conseillers des conseils et des réponses à partir de la littérature du domaine. La gestion des vaches en transition a été examinée en tant que preuve de concept.En termes d'extraction d'entités, un modèle neuronal Bi-LSTM a été formé pour cette tâche. L'ensemble de données comprenait 1152 phrases provenant de 20 articles. Ces phrases ont été divisées avec un pourcentage de 8:2, créant ainsi un ensemble de données d'entraînement de 922 phrases et un ensemble de données de test de 230 phrases. Les types d'entités étaient les maladies et la nutrition, étiquetées au format BIO (Begin, In, et Out des mots de l'entité). Trois méthodes ont été appliquées pour affiner le modèle de NER, à savoir l'augmentation du volume de données, l'ajustement des hyperparamètres et les techniques de PNL telles que l'intégration globale des vecteurs. Pendant la formation, l'augmentation des données de formation de 461 à 922 phrases, la couche LSTM bidirectionnelle avec 64 unités et l'emploi du vecteur global ont donné le meilleur résultat avec un score F1 global de 80 %. Le réseau neuronal BERT (Bidirectional Encoder Representations from Transformers) a été utilisé comme modèle d'extraction de relations. Plus précisément, il s'agit d'affiner le BERT en tant que classificateur multiclasse. Les phrases contenant deux entités ou plus prédites par le NER ont été utilisées pour entraîner le modèle d'extraction de relations. Les résultats n'ont pas été jugés satisfaisants, avec un score F1 global de 23 %, et la tâche d'extraction de relations a donc utilisé la prédiction d'un autre modèle neuronal d'extraction de relations entraîné avec Few-Rel. Après avoir introduit les données d'origine dans le modèle d'extraction d'entités et le modèle d'extraction de relations, un graphe de connaissances de 1 576 nœuds et 3 456 arêtes a été construit. Ces éléments ont été stockés dans une base de données de graphes Neo4j. Ensuite, la méthode Semantic Parsing a été utilisée pour mettre directement en correspondance la question naturelle avec la requête du graphe de connaissances. Cinq modèles de questions et règles de mise en correspondance ont été définis, et l'expression régulière a été utilisée pour fournir plus de flexibilité. En outre, pour déterminer la qualité des réponses que la connaissance construite à partir des articles, cinq réponses ont été évaluées sur la base d'un jugement humain. Les réponses ont été notées de 1 à 10 avec quatre métriques, à savoir la précision, le rappel, la granularité et l'utilité. Les scores globaux des cinq questions sur quatre métriques étaient respectivement de 7, 7.5, 7, 8 et 7. Cette étude a démontré comment extraire des connaissances à partir d'articles universitaires. Les réponses renvoyées par le graphe de connaissances impliquaient qu'il avait déjà une certaine compréhension de la gestion des vaches en transition. À l'avenir, d'autres ressources telles que des pages Web, des enregistrements de gestion à la ferme ou des connaissances d'experts pourraient être intégrées au graphe de connaissances afin de fournir des réponses plus précises
Fetched live from OpenAlex and de-inverted. Abstracts are not stored in this database: the inverted indexes are 8.6 GB of the frame’s 9.3 GB of text, and the host has 13 GB free.
How this classification was reachedexpand
Full frame distilled prediction
Teacher imitationNot calibrated prevalence, not ground truth. Human validation pending. Learned from the 10,348 direct Codex labels and 10,348 direct Gemma labels. Candidate is the union of thresholded teacher heads; consensus is their intersection. These outputs are machine_predicted_unvalidated and are not human labels or direct frontier model labels.
Codex and Gemma teacher scores by category
| Category | Codex | Gemma |
|---|---|---|
| Metaresearch | 0.000 | 0.000 |
| Meta-epidemiology (narrow) | 0.000 | 0.000 |
| Meta-epidemiology (broad) | 0.000 | 0.000 |
| Bibliometrics | 0.000 | 0.000 |
| Science and technology studies | 0.001 | 0.000 |
| Scholarly communication | 0.000 | 0.000 |
| Open science | 0.000 | 0.000 |
| Research integrity | 0.000 | 0.000 |
| Insufficient payload (model declined to judge) | 0.003 | 0.000 |
Machine scores (provisional)
The two teacher heads of the student model, read on this work. A score orders the frame for review; it never asserts a category, and the validation status ships verbatim with every row.
Baseline scores from an immature model (maturity gate not passed, 7 training rounds). Scores rank; they never assert a category.
score_only:v0-immature-baseline · verbatim from the scoring run: score_only means the number may rank works, and no category label ships from itClassification
machine, unvalidatedMachine predicted; a candidate call from one teacher head, not a consensus.
How this classification was reached, model by model and score by score, is at the end of the page under "How this classification was reached".