MétaCan
Menu
Retour à la cohorte
Enregistrement W2548113829 · doi:10.7202/1090069ar

En quête d’amitié. Approches méthodologiques pour l’analyse automatisée d’un corpus électronique

2022· article· fr· W2548113829 sur OpenAlexvenueno aff
Stéfan Sinclair, Madeleine Jeay

Notice bibliographique

RevueTopiques études satoriennes · 2022
Typearticle
Languefr
DomaineArts and Humanities
ThématiqueLinguistics and Discourse Analysis
Établissements canadiensnon disponible
Organismes subventionnairesnon disponible
Mots-clésHumanitiesSociologyPhilosophy

Résumé

récupéré en direct d'OpenAlex

Nous n’avons guère à rappeler que, depuis son fondement il y a quelque vingt-cinq ans, la Sator cherche à conjuguer la recherche littéraire avec les nouvelles technologies aptes à aider à réaliser le travail à la hauteur des ambitions du projet, c’est-à-dire à mieux comprendre et étudier la récurrence narrative dans les textes français du Moyen Âge à la fin du XVIIIe siècle. Diverses tentatives se sont succédé, que l’on pense à Toposator, SatorBase, TopoScan, PBLit, et d’autres initiatives connexes, chacune laissant entrevoir un nouveau monde de possibilités tout en nous laissant sur notre faim. Qu’est-ce qui distingue alors ce nouveau projet portant le nom Toucher (Textes, Outils, chercheur en réseau) ? Très peu, à certains égards : il s’agit toujours d’un groupe de chercheurs à la fois convaincus et circonspects au sujet du potentiel de l’informatique pour enrichir et multiplier les façons d’étudier les phénomènes littéraires. Cela dit, quelques différences essentielles existent, motivées par l’expérience et une réflexion honnête sur l’appui réel que peut apporter l’informatique aux chercheurs individuels et à l’équipe. Le concept du réseau nous a paru propice pour structurer nos objectifs, tant pour les composantes individuelles (les textes, les outils, les chercheurs), que pour le réseau qui peut se dessiner entre les composantes (un véritable réseau de réseau, ou internet). Dès lors, il ne s’agit plus simplement de créer un outil en isolation qu’on espère saura convaincre un utilisateur éventuel, mais plutôt de prendre conscience de l’ensemble des textes disponibles et de réfléchir à quelles sortes d’outils s’insérerait le plus naturellement dans les pratiques actuelles des chercheurs. Nous présenterons dans cet article les premières balbutiements du projet Toucher. En particulier, nous décrirons notre utilisation de Zotero, un outil bibliographique collaboratif, pour compiler un grand nombre de textes déjà numérisés (en différents formats et états). De là, nous présenterons un outil de balisage topique développé pour le projet qui permet de classifier des occurrences de mots-clés ainsi que les termes contribuant à la classification. Le but de cet outil est de permettre à la machine d’apprendre à reconnaître elle-même des occurrences possibles, ce qui permettrait de constituer une ressource extrêmement puissante : un utilisateur pourrait chercher dans un grand corpus des exemples possibles d’occurrences topiques afin d’enrichir la compréhension de phénomènes locaux ou d’alimenter une réflexion sur des phénomènes plus larges. Ainsi, textes, outils et chercheurs fonctionnent en réseau.

Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.

Comment cette classification a été obtenuedéplier

Prédiction distillée sur la base complète

Imitation des enseignants

Ni prévalence calibrée, ni vérité terrain. Validation humaine à venir. Apprise à partir de 10 348 étiquettes directes de Codex et de 10 348 étiquettes directes de Gemma. Le mode candidate est l'union des têtes enseignantes seuillées; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont ni des étiquettes humaines ni des étiquettes directes de modèles de pointe.

score de la tête « metaresearch » (Codex)0,002
score de la tête « metaresearch » (Gemma)0,000
Version: codex-gemma-dda1882f352aStatut de validation: machine_predicted_unvalidated
Catégories candidatesMéta-épidémiologie (sens strict), Études des sciences et des technologies, Charge utile insuffisante (le modèle a refusé de juger)
Catégories consensuellesaucune
DomaineSignal candidat: aucune · Signal consensuel: aucune
Devis d'étudeSignal candidat: Théorique ou conceptuel · Signal consensuel: aucune
GenreSignal candidat: Empirique · Signal consensuel: Empirique
Score de désaccord entre enseignants0,812
Score d'incertitude au seuil1,000

Scores Codex et Gemma par catégorie

CatégorieCodexGemma
Métarecherche0,0020,000
Méta-épidémiologie (sens strict)0,0010,001
Méta-épidémiologie (sens large)0,0010,001
Bibliométrie0,0000,000
Études des sciences et des technologies0,0020,001
Communication savante0,0010,000
Science ouverte0,0010,001
Intégrité de la recherche0,0000,001
Charge utile insuffisante (le modèle a refusé de juger)0,0100,000

Scores machine (provisoires)

Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.

Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.

Tête enseignante Opus0,034
Tête enseignante GPT0,278
Écart entre enseignants0,243 · la distance entre les deux têtes enseignantes sur ce seul travail
Statut de validationscore_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découle

Classification

machine, non validée

Prédiction automatique; un appel candidat d’une seule tête enseignante, pas un consensus.

Devis d'étudeThéorique ou conceptuel
Domainenon disponible
GenreEmpirique

Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».

En bref

Citations0
Publié2022
Routes d'admission1
Résumé présentoui

Explorer davantage

Même revueTopiques études satoriennesMême sujetLinguistics and Discourse AnalysisTravaux en français237 207