Notice bibliographique
Résumé
In Digital Humanities the task of “text modelling” has been recognised and successfully treated in the last decades. But indeed every use of digital text processing software, even the most naive one, is already a kind of text modelling activity. In many realms of daily practice this is executed unknowingly and without theoretic reflection, using digital text processing systems merely as “comfortable typewriters”. Then the structure of the out-coming models is determined only by the applied software. To really exploit the benefits of automated text processing in any realm, their use must change to a theory and practice of text modelling. This requires to explore and make explicit the mathematical structure of the possible text models, and the restrictions imposed on them a priori by the involved technical tools. Those can become crucial especially. when translating a text between two formats – a quite frequent task with surprising pitfalls. This article gives a systematic and exhaustive survey of the technically determined structural properties of text models. It lists the abstract requirements on modelling tools for ensuring satisfactory flexibility, and compares ten different commonly used text modelling frameworks. Résumé Les systèmes de traitement de texte numériques s’utilisent, dans la majorité des cas, simplement comme des « machines à écrire confortables », surtout dans les Humanités. Pour profiter véritablement des avantages du traitement de texte automatisé, surtout au niveau conceptuel, l’usage de ces systèmes de traitement doit changer vers une théorie et pratique de modélisation de texte. Pour cela, il faut explorer et rendre explicite la structure mathématique de modèles de texte possibles, ainsi que les restrictions imposées a priori sur ces systèmes par les outils techniques impliqués. Celles-là peuvent devenir essentielles, particulièrement lorsque l’on convertit un texte entre deux formats – ce qui est une tâche très fréquente avec des écueils surprenants. Cet article offre une étude systématique et exhaustive des caractéristiques structurelles de modèles de texte. Il énumère les exigences abstraites d’outils de modélisation nécessaires pour garantir une flexibilité satisfaisante et il compare dix différents cadres de modélisation de texte fréquemment utilisés. Mots-clés: Traitement de texte; Type de document; Enquête sur les normes; Modélisation mathématique
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction distillée sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Apprise à partir de 10 348 étiquettes directes de Codex et de 10 348 étiquettes directes de Gemma. Le mode candidate est l'union des têtes enseignantes seuillées; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont ni des étiquettes humaines ni des étiquettes directes de modèles de pointe.
Scores Codex et Gemma par catégorie
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,000 | 0,001 |
| Méta-épidémiologie (sens strict) | 0,000 | 0,000 |
| Méta-épidémiologie (sens large) | 0,001 | 0,000 |
| Bibliométrie | 0,000 | 0,000 |
| Études des sciences et des technologies | 0,001 | 0,003 |
| Communication savante | 0,001 | 0,001 |
| Science ouverte | 0,000 | 0,001 |
| Intégrité de la recherche | 0,000 | 0,000 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,001 | 0,000 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule tête enseignante, pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».