Development of a knowledge graph for the Canadian milk-recording industry
Notice bibliographique
Résumé
Étant donné la diversité des processus de gestion dans de nombreux domaines agricoles, les techniques d'apprentissage automatique et la théorie des graphes de connaissances ont été explorées en vue de créer un système d'aide à la décision capable de fournir aux producteurs et à leurs conseillers des conseils et des réponses à partir de la littérature du domaine. La gestion des vaches en transition a été examinée en tant que preuve de concept.En termes d'extraction d'entités, un modèle neuronal Bi-LSTM a été formé pour cette tâche. L'ensemble de données comprenait 1152 phrases provenant de 20 articles. Ces phrases ont été divisées avec un pourcentage de 8:2, créant ainsi un ensemble de données d'entraînement de 922 phrases et un ensemble de données de test de 230 phrases. Les types d'entités étaient les maladies et la nutrition, étiquetées au format BIO (Begin, In, et Out des mots de l'entité). Trois méthodes ont été appliquées pour affiner le modèle de NER, à savoir l'augmentation du volume de données, l'ajustement des hyperparamètres et les techniques de PNL telles que l'intégration globale des vecteurs. Pendant la formation, l'augmentation des données de formation de 461 à 922 phrases, la couche LSTM bidirectionnelle avec 64 unités et l'emploi du vecteur global ont donné le meilleur résultat avec un score F1 global de 80 %. Le réseau neuronal BERT (Bidirectional Encoder Representations from Transformers) a été utilisé comme modèle d'extraction de relations. Plus précisément, il s'agit d'affiner le BERT en tant que classificateur multiclasse. Les phrases contenant deux entités ou plus prédites par le NER ont été utilisées pour entraîner le modèle d'extraction de relations. Les résultats n'ont pas été jugés satisfaisants, avec un score F1 global de 23 %, et la tâche d'extraction de relations a donc utilisé la prédiction d'un autre modèle neuronal d'extraction de relations entraîné avec Few-Rel. Après avoir introduit les données d'origine dans le modèle d'extraction d'entités et le modèle d'extraction de relations, un graphe de connaissances de 1 576 nœuds et 3 456 arêtes a été construit. Ces éléments ont été stockés dans une base de données de graphes Neo4j. Ensuite, la méthode Semantic Parsing a été utilisée pour mettre directement en correspondance la question naturelle avec la requête du graphe de connaissances. Cinq modèles de questions et règles de mise en correspondance ont été définis, et l'expression régulière a été utilisée pour fournir plus de flexibilité. En outre, pour déterminer la qualité des réponses que la connaissance construite à partir des articles, cinq réponses ont été évaluées sur la base d'un jugement humain. Les réponses ont été notées de 1 à 10 avec quatre métriques, à savoir la précision, le rappel, la granularité et l'utilité. Les scores globaux des cinq questions sur quatre métriques étaient respectivement de 7, 7.5, 7, 8 et 7. Cette étude a démontré comment extraire des connaissances à partir d'articles universitaires. Les réponses renvoyées par le graphe de connaissances impliquaient qu'il avait déjà une certaine compréhension de la gestion des vaches en transition. À l'avenir, d'autres ressources telles que des pages Web, des enregistrements de gestion à la ferme ou des connaissances d'experts pourraient être intégrées au graphe de connaissances afin de fournir des réponses plus précises
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction distillée sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Apprise à partir de 10 348 étiquettes directes de Codex et de 10 348 étiquettes directes de Gemma. Le mode candidate est l'union des têtes enseignantes seuillées; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont ni des étiquettes humaines ni des étiquettes directes de modèles de pointe.
Scores Codex et Gemma par catégorie
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,000 | 0,000 |
| Méta-épidémiologie (sens strict) | 0,000 | 0,000 |
| Méta-épidémiologie (sens large) | 0,000 | 0,000 |
| Bibliométrie | 0,000 | 0,000 |
| Études des sciences et des technologies | 0,001 | 0,000 |
| Communication savante | 0,000 | 0,000 |
| Science ouverte | 0,000 | 0,000 |
| Intégrité de la recherche | 0,000 | 0,000 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,003 | 0,000 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule tête enseignante, pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».