MétaCan
Menu
Retour à la cohorte
Enregistrement W4410932950 · doi:10.1186/s13750-025-00362-9

Evaluating generative AI for qualitative data extraction in community-based fisheries management literature

2025· article· en· W4410932950 sur OpenAlexfundno aff
Scott Spillias, Katherine May Ollerhead, Matthew Andreotta, R Annand-Jones, Fabio Boschetti, James Duggan, Denis B. Karcher, Cécile Paris, Rebecca Shellock, Rowan Trebilco

Notice bibliographique

RevueEnvironmental Evidence · 2025
Typearticle
Langueen
DomaineSocial Sciences
ThématiqueComputational and Text Analysis Methods
Établissements canadiensnon disponible
Organismes subventionnairesCentre for Marine SocioecologyCanada Excellence Research Chairs, Government of CanadaCommonwealth Scientific and Industrial Research Organisation
Mots-clésContext (archaeology)Computer scienceData scienceData extractionGenerative grammarSystematic reviewKnowledge managementArtificial intelligenceMEDLINEPolitical science

Résumé

récupéré en direct d'OpenAlex

Uptake of AI tools in knowledge production processes is rapidly growing. In this pilot study, we explore the ability of generative AI tools to reliably extract qualitative data from a limited sample of peer-reviewed documents in the context of community-based fisheries management (CBFM) literature. Specifically, we evaluate the capacity of multiple AI tools to analyse 33 CBFM papers and extract relevant information for a systematic literature review, comparing the results to those of human reviewers. We address how well AI tools can discern the presence of relevant contextual data, whether the outputs of AI tools are comparable to human extractions, and whether the difficulty of question influences the performance of the extraction. While the AI tools we tested (GPT4-Turbo and Elicit) were not reliable in discerning the presence or absence of contextual data, at least one of the AI tools consistently returned responses that were on par with human reviewers. These results highlight the potential utility of AI tools in the extraction phase of evidence synthesis for supporting human-led reviews, while underscoring the ongoing need for human oversight. This exploratory investigation provides initial insights into the current capabilities and limitations of AI in qualitative data extraction within the specific domain of CBFM, laying groundwork for future, more comprehensive evaluations across diverse fields and larger datasets.

Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.

Comment cette classification a été obtenuedéplier

Prédiction machine sur la base complète

Imitation des enseignants

Ni prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.

score de la tête « metaresearch » (Codex)0,360
score de la tête « metaresearch » (Gemma)0,736
Version: metacan-v3-hybrid-931329e0061cStatut de validation: machine_predicted_unvalidated
Catégories candidatesMétarecherche
Catégories consensuellesMétarecherche
DomaineSignal candidat: Méthodes · Signal consensuel: aucune
Devis d'étudeSignal candidat: Observationnel · Signal consensuel: aucune
GenreSignal candidat: Empirique · Signal consensuel: aucune
Score de désaccord entre enseignants0,640
Score d'incertitude au seuil0,789

Scores du classifieur distillé par catégorie (deux têtes)

CatégorieCodexGemma
Métarecherche0,3600,736
Méta-épidémiologie (sens strict)0,0020,002
Méta-épidémiologie (sens large)0,0020,004
Bibliométrie0,0280,019
Études des sciences et des technologies0,0030,004
Communication savante0,0120,009
Science ouverte0,0050,011
Intégrité de la recherche0,0020,002
Charge utile insuffisante (le modèle a refusé de juger)0,0070,001

Scores machine (provisoires)

Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.

Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.

Tête enseignante Opus0,288
Tête enseignante GPT0,556
Écart entre enseignants0,268 · la distance entre les deux têtes enseignantes sur ce seul travail
Statut de validationscore_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découle

Classification

machine, non validée

Prédiction automatique; l’étiquette directe de Gemma et le classifieur distillé Codex s’accordent sur ce qui est montré ici.

Devis d'étudeObservationnel
DomaineMéthodes
GenreEmpirique

Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».

En bref

Citations9
Publié2025
Routes d'admission1
Résumé présentoui

Explorer davantage

Même revueEnvironmental EvidenceMême sujetComputational and Text Analysis MethodsTravaux en français237 207