MétaCan
Menu
← Retour à la cohorte
Enregistrement W2555952258 · doi:10.14288/1.0307549

Découverte des données de recherche et écosystème du savoir au Canada : Livre blanc

2016· article· fr· W2555952258 sur OpenAlexaboutno aff
Eugene Barsky, John Brosz, Amber Leahey

Notice bibliographique

RevuecIRcle (University of British Columbia) · 2016
Typearticle
Languefr
DomaineComputer Science
ThématiqueCultural Insights and Digital Impacts
Établissements canadiensnon disponible
Organismes subventionnairesnon disponible
Mots-clésGeographyPolitical science

Résumé

récupéré en direct d'OpenAlex

Il faut que les données de recherche soient explorables pour être réutilisées. L’exploration des données correspond au traitement descriptif et technique des données et des métadonnées ainsi qu’aux outils et à l’infrastructure visant à améliorer l’accès aux données de recherche sur Internet et leur réutilisation. Un service canadien d'exploration des données faciliterait la découverte et la réutilisation des données de recherche conservées dans des dépôts institutionnels et disciplinaires. Nous aimerions voir un service qui offrirait un point d’accès cohérent aux descriptions (métadonnées) fiables, consultables, explorables et susceptibles d’action par les machines pour les ensembles de données, et qui offrirait des moyens clairs pour y accéder, ce qui accroîtrait les chances d'exploration et de réutilisation des données de recherche au Canada. Dans le document qui suit, nous faisons ressortir les possibilités et problématiques actuelles concernant l’élaboration d’un tel service au Canada. À l’aide d’une enquête concernant les dépôts de données de recherche et les services d’exploration des données nationaux et internationaux, nous proposons un ensemble de principes directeurs, de pratiques exemplaires et de recommandations pour l’exploration des données: Métadonnées communes : Les renseignements descriptifs qui accompagnent les données de recherche doivent respecter des normes minimales pour favoriser l’exploration et soutenir la réutilisation des données. Cette exigence requiert un engagement pour un ensemble fondamental de composants de métadonnées dans tous les domaines. Les outils de métadonnées devraient permettre de multiples espaces de nommage de métadonnées – termes descriptifs assignés, gérés et regroupés en collections de catégories et attributs. Nous recommandons également de créer multiples outils de prospection de données souples pour l’indexation des dépôts spécialisés afin que l’on puisse conserver la granularité et les métadonnées propres à un domaine dans leur format original. Identification permanente : L’utilisation d’identifiants universels pour les chercheurs et les données de recherche. Nous recommandons d’envisager une entente nationale d’ORCID afin que les universités et les organismes gouvernementaux du Canada puissent intégrer des identifiants de chercheur dans des logiciels de gestion et de publication de recherche institutionnels ou d’autre nature. Nous recommandons également d’enregistrer des identifiants numériques d’objet (DOI) se rattachant aux ensembles de données dans les dépôts participants auprès de DataCite Canada. Ces DOI amélioreront grandement l’exploration des ensembles de données par l’entremise des partenaires de métadonnées de DataCite (p. ex., ORCID, VIVO, etc.). Interfaces programmatiques et à libre accès : Une interface de programmation qui permet à un composant logiciel d’utiliser la fonctionnalité ou les données mises à la disposition d’un autre par l’entremise d’un ensemble de routines, de protocoles et d’outils. Les dépôts et les services d’exploration des données participants devraient offrir une interface de programmation permettant à des programmes d’accéder aux données et aux métadonnées à des fins de réutilisation et de développement. Licences communes : Il faudrait établir des politiques d’octroi de licences pour les données et les métadonnées et, dans la mesure du possible, celles-ci devraient être le moins restrictives possible. Nous recommandons d’utiliser des licences Creative Commons pour les données de recherche puisqu’elles transmettent efficacement des renseignements sur les intentions des titulaires du droit d’auteur et qu’elles clarifient les usages autorisés. Les licences peuvent s’appliquer aux données et aux métadonnées, même si nous recommandons fortement d’offrir les métadonnées le plus librement possible, avec des restrictions minimales ou nulles sur leur réutilisation pour en faciliter l'exploration. Collaboration : Un engagement pour la reconnaissance et la collaboration partagées entre les acteurs, les organisations, les producteurs de données et les chercheurs, que l’on peut aussi qualifier de « coexistence dans l’écosystème du savoir ». Nous insistons sur le fait que la collaboration constituera le grand facteur déterminant de l’amélioration de l'exploration des données au Canada. Un projet national bien coordonné permettra de s'assurer que toutes les tentatives d’amélioration de l'exploration et de la consultation des données seront éclairées et facilitées par les attentes, la participation et la collaboration des intervenants. La mobilisation des intervenants et l’établissement de canaux de communication clairs sont essentiels à la réussite d’un service national d’exploration des données. Le document qui suit est présenté avec un objectif commun, soit celui de favoriser le plus possible l’exploration et la consultation des données de recherche, et d’améliorer conséquemment les possibilités de reproductibilité et de réutilisation des données. L’amélioration de l'exploration des données constitue une manière de faciliter l’interopérabilité et l’exploration accrues des résultats savants. L’élaboration d’une infrastructure nationale qui rehausse l’exploration des données de recherche améliorera les possibilités d’intégration additionnelle au cœur de l’écosystème du savoir, ce qui comprend le soutien pour les métadonnées, les identifiants universels, et les interfaces programmatiques à libre accès.

Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.

Comment cette classification a été obtenuedéplier

Prédiction machine sur la base complète

Imitation des enseignants

Ni prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.

score de la tête « metaresearch » (Codex)0,006
score de la tête « metaresearch » (Gemma)0,013
Version: metacan-v3-hybrid-931329e0061cStatut de validation: machine_predicted_unvalidated
Catégories candidatesCommunication savante, Science ouverte
Catégories consensuellesaucune
DomaineSignal candidat: aucune · Signal consensuel: aucune
Devis d'étudeSignal candidat: Sans objet · Signal consensuel: aucune
GenreSignal candidat: Autre · Signal consensuel: aucune
Score de désaccord entre enseignants0,997
Score d'incertitude au seuil0,358

Scores du classifieur distillé par catégorie (deux têtes)

CatégorieCodexGemma
Métarecherche0,0060,013
Méta-épidémiologie (sens strict)0,0010,001
Méta-épidémiologie (sens large)0,0010,002
Bibliométrie0,0050,010
Études des sciences et des technologies0,0110,007
Communication savante0,0150,006
Science ouverte0,0030,005
Intégrité de la recherche0,0020,004
Charge utile insuffisante (le modèle a refusé de juger)0,0090,002

Scores machine (provisoires)

Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.

Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.

Tête enseignante Opus0,207
Tête enseignante GPT0,241
Écart entre enseignants0,034 · la distance entre les deux têtes enseignantes sur ce seul travail
Statut de validationscore_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découle

Classification

machine, non validée

Prédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.

Devis d'étudeSans objet
Domainenon disponible
GenreAutre

Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».

En bref

Citations0
Publié2016
Routes d'admission1
Résumé présentoui

Explorer davantage

Même revuecIRcle (University of British Columbia)→Même sujetCultural Insights and Digital Impacts→Travaux en français237 207→