MétaCan
Menu
Retour à la cohorte
Enregistrement W2156897283 · doi:10.1002/asi.22695

Author name disambiguation: What difference does it make in author‐based citation analysis?

2012· article· en· W2156897283 sur OpenAlexaff
Andreas Strotmann, Dangzhi Zhao

Notice bibliographique

RevueJournal of the American Society for Information Science and Technology · 2012
Typearticle
Langueen
DomaineDecision Sciences
ThématiqueData Quality and Management
Établissements canadiensUniversity of Alberta
Organismes subventionnairesnon disponible
Mots-clésWorkaroundCitationComputer scienceAmbiguityRanking (information retrieval)Field (mathematics)Information retrievalCitation analysisJournal rankingPublicationData scienceWorld Wide WebPolitical scienceMathematics

Résumé

récupéré en direct d'OpenAlex

In this article, we explore how strongly author name disambiguation ( AND ) affects the results of an author‐based citation analysis study, and identify conditions under which the traditional simplified approach of using surnames and first initials may suffice in practice. We compare author citation ranking and cocitation mapping results in the stem cell research field from 2004 to 2009 using two AND approaches: the traditional simplified approach of using author surname and first initial and a sophisticated algorithmic approach. We find that the traditional approach leads to extremely distorted rankings and substantially distorted mappings of authors in this field when based on first‐ or all‐author citation counting, whereas last‐author‐based citation ranking and cocitation mapping both appear relatively immune to the author name ambiguity problem. This is largely because R omanized names of C hinese and K orean authors, who are very active in this field, are extremely ambiguous, but few of these researchers consistently publish as last authors in bylines. We conclude that a more earnest effort is required to deal with the author name ambiguity problem in both citation analysis and information retrieval, especially given the current trend toward globalization. In the stem cell research field, in which laboratory heads are traditionally listed as last authors in bylines, last‐author‐based citation ranking and cocitation mapping using the traditional approach to author name disambiguation may serve as a simple workaround, but likely at the price of largely filtering out C hinese and K orean contributions to the field as well as important contributions by young researchers.

Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.

Comment cette classification a été obtenuedéplier

Étiquettes directes de modèles (non validées)

Étiquettes de catégorie et de devis d'étude par modèle, issues des rondes d'étiquetage. C'est une sortie machine, non validée, et le désaccord entre modèles est livré comme donnée. Aucun devis ici n'est encore validé contre MEDLINE.

BrasCatégoriesDevis d'étudeConfiance
gemmaMétarechercheBibliométrie
Domaine: Méthodes · Genre: Empirique
Porte sur le système de recherche canadien: non · Porte sur un sujet canadien: non
Simulation ou modélisationlow
gptMétarechercheBibliométrie
Domaine: Méthodes · Genre: Méthodes
Porte sur le système de recherche canadien: non · Porte sur un sujet canadien: non
Autre devishigh
modèles en désaccordL'accord compare des ensembles de catégories et des devis identiques entre les bras.

Prédiction machine sur la base complète

Imitation des enseignants

Ni prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.

score de la tête « metaresearch » (Codex)0,131
score de la tête « metaresearch » (Gemma)0,443
Version: metacan-v3-hybrid-931329e0061cStatut de validation: machine_predicted_unvalidated
Catégories candidatesMétarecherche, Bibliométrie
Catégories consensuellesaucune
DomaineSignal candidat: Méthodes · Signal consensuel: aucune
Devis d'étudeSignal candidat: Simulation ou modélisation · Signal consensuel: aucune
GenreSignal candidat: Empirique · Signal consensuel: aucune
Score de désaccord entre enseignants0,991
Score d'incertitude au seuil0,691

Scores du classifieur distillé par catégorie (deux têtes)

CatégorieCodexGemma
Métarecherche0,1310,443
Méta-épidémiologie (sens strict)0,0010,001
Méta-épidémiologie (sens large)0,0020,001
Bibliométrie0,0090,024
Études des sciences et des technologies0,0040,008
Communication savante0,0150,029
Science ouverte0,0030,005
Intégrité de la recherche0,0030,004
Charge utile insuffisante (le modèle a refusé de juger)0,0020,002

Scores machine (provisoires)

Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.

Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.

Tête enseignante Opus0,091
Tête enseignante GPT0,409
Écart entre enseignants0,318 · la distance entre les deux têtes enseignantes sur ce seul travail
Statut de validationscore_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découle

Classification

machine, non validée

Étiqueté directement par 2 modèles lisant le dossier complet.

MétarechercheBibliométrie

Les modèles divergent sur des parties de cette classification; chaque voix est préservée dans la section en fin de page.

Devis d'étudeSimulation ou modélisation · Autre devis
DomaineMéthodes
GenreEmpirique · Méthodes

Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».

En bref

Citations134
Publié2012
Routes d'admission1
Résumé présentoui

Explorer davantage

Même revueJournal of the American Society for Information Science and TechnologyMême sujetData Quality and ManagementCatégorieMétarechercheTravaux en français237 207