Concept Detection in Philosophical Corpora
Notice bibliographique
Résumé
During the course of research, scholars often search large textual databases for segments of text relevant to their conceptual analyses. This study proposes, develops and evaluates two applications of word embedding algorithms for automated Concept Detection in theoretical corpora: Average Cosine Similarity Retrieval (ACS) and Word Mover’s Distance Retrieval (WMDR). Both strategies are evaluated against weighted keyword (KW) search using a test set from the Digital Ricœur corpus tagged by scholarly experts. In our experiments, WMDR outperformed weighted keyword search on the Concept Detection task, which suggests it is a promising strategy for Concept Detection and information retrieval systems focused on theoretical corpora. Besides these initial positive results, WMDRl has as its major characteristic the ability to use definitions as proxies for concepts; this provides search results that account for the semantic contexts of theoretical concepts.Au cours de la recherche, les chercheurs tâchent souvent de trouver des segments de texte pertinents dans d’énormes bases de données textuelles pour leurs analyses conceptuelles. Cet article propose, développe et évalue deux applications d’algorithmes de word embedding (plongement lexical) pour la Concept Detection (détection de concept) dans des corpus théoriques : dans l’Average Cosine Similarity Retrieval (ACS – Extraction de similitudes cosinus moyenne) et dans la Word Mover’s Distance Retrieval (WMDR – Extraction de distance de déplacement lexique). Les deux stratégies seront évaluées par rapport à une recherche par mot-clés pondérée avec un dispositif de test venant du corpus Digital Ricœur, qui est étiqueté par des experts érudits. Dans nos expériences, la WMDR était plus performante que la recherche par mot-clés pondérée durant la tâche de détection de concept, ce qui suggère que cela soit une stratégie prometteuse pour la détection de concept et pour des systèmes d’extraction d’information axés sur des corpus théoriques. En outre, la WMDR a comme caractéristique majeure la capacité de se servir de définitions en tant que des proxys pour des concepts. Cela fournit des résultats de recherche qui explique les contextes sémantiques de concepts théoriques.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction distillée sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Apprise à partir de 10 348 étiquettes directes de Codex et de 10 348 étiquettes directes de Gemma. Le mode candidate est l'union des têtes enseignantes seuillées; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont ni des étiquettes humaines ni des étiquettes directes de modèles de pointe.
Scores Codex et Gemma par catégorie
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,000 | 0,000 |
| Méta-épidémiologie (sens strict) | 0,000 | 0,000 |
| Méta-épidémiologie (sens large) | 0,000 | 0,000 |
| Bibliométrie | 0,000 | 0,001 |
| Études des sciences et des technologies | 0,000 | 0,000 |
| Communication savante | 0,000 | 0,001 |
| Science ouverte | 0,001 | 0,001 |
| Intégrité de la recherche | 0,000 | 0,000 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,000 | 0,000 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule tête enseignante, pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».