Canadian Dataverse Admin Survey - Individual (2023)
Notice bibliographique
Résumé
The Canadian Dataverse Admin Survey - Individual (2023) was conducted to gain insight into the growing community of Canadian Dataverse Collection Administrators—librarians or other institutional staff members who manage an institutional Dataverse collection (or repository) and provide support to the members of their designated local research community. The Principal Investigators (PIs) of the study are Meghan Goodchild, PhD (Queen’s University / Scholars Portal) and Alisa Rod, PhD (McGill University), who lead the “Canadian Dataverse Administrators Survey Working Group,” a subgroup of the Dataverse North Expert Group of the Digital Research Alliance of Canada. Working Group members include: Shahira Khair (University of Victoria), Danica Evering (McMaster University), Alexander Jerabek (Université du Québec à Montréal), Tara Stieglitz (MacEwan University), Lacey Cain (Carleton University), and Lina Marie Harper (Digital Research Alliance of Canada), with support from John Huck (University of Alberta) and Amber Leahey (Scholars Portal). This dataset contains a README file (TXT), documentation (PDFs), the de-identified quantiative dataset (CSV), and R markdown notebook scripts to produce the figures (RMD). Le sondage sur les administrateur(trice)s du Dataverse canadien – Individus (2023) a été menée pour étudier sur la communauté grandissante des administrateur(trice)s du Dataverse canadien, soit les bibliothécaires et autres membres du personnel qui gèrent une collection Dataverse institutionnelle (ou un dépôt) et fournissent du soutien aux membres de leur communauté de recherche locale désignée. Les chercheuses principales du sondage sur les administrateur(trice)s du Dataverse canadien sont Meghan Goodchild, Ph. D. (Université Queen’s/Scholars Portal) et Alisa Rod, Ph. D. (Université McGill), qui dirigent le « groupe de travail sur le sondage sur les administrateur(trice)s du Dataverse canadien », un sous-groupe du groupe d’experts sur Dataverse Nord de l’Alliance de recherche numérique du Canada. Les membres du groupe de travail sont Lacey Cain (Université Carleton), Danica Evering (Université McMaster), Lina Marie Harper (Alliance de recherche numérique du Canada), Alexander Jerabek (Université du Québec à Montréal), Shahira Khair (Université de Victoria) et Tara Stieglitz (Université MacEwan), avec le soutien de John Huck (Université de l’Alberta) et d’Amber Leahey (Scholars Portal). Cet ensemble de données contient un fichier README (TXT), de la documentation (PDF), l'ensemble de données quantitatives anonymisées (CSV) et des scripts de carnets de démarquage R pour produire les chiffres (RMD).
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction machine sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.
Scores du classifieur distillé par catégorie (deux têtes)
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,008 | 0,028 |
| Méta-épidémiologie (sens strict) | 0,001 | 0,001 |
| Méta-épidémiologie (sens large) | 0,001 | 0,001 |
| Bibliométrie | 0,006 | 0,017 |
| Études des sciences et des technologies | 0,005 | 0,001 |
| Communication savante | 0,005 | 0,002 |
| Science ouverte | 0,002 | 0,003 |
| Intégrité de la recherche | 0,001 | 0,002 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,157 | 0,056 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».