How authors cite references? A study of characteristics of in‐text citations
Notice bibliographique
Résumé
ABSTRACT How to differentiate citations is continuously an important research question of citation analysis. Recently, some researchers analyze full‐text academic articles with tools and techniques of natural language processing to find out the characteristics of in‐text citations. In this study, we analyze 4,255 articles published during 2007 to 2016 to explore how authors of library and information science (LIS) cite references in their articles. The pattern of citations shows that LIS authors cite more works on average but the average in‐text citation times per reference in an article only increase slightly in this period. There are more in‐text citations in the first quarter fraction of an article and the number of in‐text citations decrease gradually with text progression. The distribution of POS shows that when LIS authors mention references in text body, they use more noun, verb, and preposition than less adjective and adverb. We also choose the high frequency words of different POS to investigate which words authors prefer in in‐text citations. In these high frequency words, nouns tend to be about research topics. Verbs are neutral or used to describe methods or findings of these cited works. As to adjective and adverb, most of them are positive or neutral. But there are more negative words in adverb.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction distillée sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Apprise à partir de 10 348 étiquettes directes de Codex et de 10 348 étiquettes directes de Gemma. Le mode candidate est l'union des têtes enseignantes seuillées; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont ni des étiquettes humaines ni des étiquettes directes de modèles de pointe.
Scores Codex et Gemma par catégorie
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,016 | 0,109 |
| Méta-épidémiologie (sens strict) | 0,000 | 0,000 |
| Méta-épidémiologie (sens large) | 0,000 | 0,000 |
| Bibliométrie | 0,026 | 0,108 |
| Études des sciences et des technologies | 0,000 | 0,001 |
| Communication savante | 0,000 | 0,002 |
| Science ouverte | 0,001 | 0,000 |
| Intégrité de la recherche | 0,000 | 0,000 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,000 | 0,000 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; les deux têtes enseignantes s’accordent sur ce qui est montré ici.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».