Assessing the Value of Transformative Agreements: An Automated Approach to Estimating Article Processing Charge (APC) Discounts
Notice bibliographique
Résumé
Transformative Agreements (TAs) aim to transition publishers from traditional subscription models to read-publish models that promote open access publishing through discounted or waived Article Processing Charges (APCs). As academic libraries increasingly adopt TAs with publishers, evaluating the financial impact of these agreements on libraries (and the researchers they support) remains a complex task. This presentation will demonstrate an approach to automating the estimation of APC discounts associated with TAs at a large research-intensive university. Utilizing the free OpenAlex API, the presenters developed a programmatic approach to identifying discount-eligible publications, and the APC list prices for the journals in which they appeared. By co-ordinating this data with the specific discounts associated with the university’s TAs, we were able to estimate the total potential savings these agreements provided to the university’s research community. By leveraging computational notebooks for code development (Jupyter), we automated the process of data extraction and analysis and created a clearly documented approach for assessing the value of the university’s TAs moving forward. Attendees will learn how we used the OpenAlex API to retrieve APC data and how we applied discount structures for the university’s multiple TAs. We will discuss challenges encountered, including data inconsistency, and the methods used to address these issues. Ultimately, this automated approach will allow for ongoing assessment of the financial value of TAs, aiding in future decision-making for both the library and the university. Attendees will gain insight into how computational notebooks support automated data retrieval/analysis and will be left with a template for evaluating the TAs at their own institutions.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction machine sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.
Scores du classifieur distillé par catégorie (deux têtes)
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,005 | 0,034 |
| Méta-épidémiologie (sens strict) | 0,001 | 0,001 |
| Méta-épidémiologie (sens large) | 0,001 | 0,001 |
| Bibliométrie | 0,009 | 0,007 |
| Études des sciences et des technologies | 0,001 | 0,000 |
| Communication savante | 0,004 | 0,003 |
| Science ouverte | 0,001 | 0,001 |
| Intégrité de la recherche | 0,001 | 0,001 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,015 | 0,003 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».