MétaCan
Menu
Retour à la cohorte
Enregistrement W2737647136 · doi:10.3897/rio.3.e15133

Data Management Plan: HarassMap

2017· article· en· W2737647136 sur OpenAlexfundno aff
Reem Wael

Notice bibliographique

RevueResearch Ideas and Outcomes · 2017
Typearticle
Langueen
DomaineComputer Science
ThématiqueCybercrime and Law Enforcement Studies
Établissements canadiensnon disponible
Organismes subventionnairesInternational Development Research Centre
Mots-clésSocial mediaHarassmentWorld Wide WebComputer scienceDownloadInternet privacyConfidentialityAnonymityRaw dataComputer securityPolitical science

Résumé

récupéré en direct d'OpenAlex

HarassMap is an Egyptian organisation that works to create an environment where sexual harassment is not tolerated, and where individuals and institutions take action against it. For the purpose of this project, the project team cleaned up, organised, and made openly available for the public to access and use through a web portal, three main types of data: Crowdsourced reports of sexual harassment incidents (reports on HarassMap’s online reporting and mapping system) - CSV and XLS Field data from HarassMap’s research on sexual harassment using traditional qualitative and quantitative research methods - DOCX, PDF, SAV, MP3 Social media conversations (comment threads and messages related to sexual harassment on harassMap’s Facebook page) - XLS The social media data was collected retrospectively from our Facebook page during the project period and covers the period 2010-2016. The crowdsourced data and the research data was cleaned and organised to make sure it is usable for the public but still kept in its raw format. During the collection and organisation period, we also made sure to clear out all personal identifiers from the data to ensure anonymity and confidentiality, and prepared descriptions of each dataset that will help the public understand how the data was collected and how it can and cannot be used. The data is stored online on a web portal that we built together with a web developer during the project period. On the web portal, the data is available for the public to view, search and download for research or other purposes. The data is also backed up on a hard drive and the cloud. The web portal and HarassMap open data will be advertised on our website, and the direct link shared with our contacts and others who approach us with interest in our data.

Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.

Comment cette classification a été obtenuedéplier

Prédiction machine sur la base complète

Imitation des enseignants

Ni prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.

score de la tête « metaresearch » (Codex)0,026
score de la tête « metaresearch » (Gemma)0,126
Version: metacan-v3-hybrid-931329e0061cStatut de validation: machine_predicted_unvalidated
Catégories candidatesCharge utile insuffisante (le modèle a refusé de juger)
Catégories consensuellesaucune
DomaineSignal candidat: aucune · Signal consensuel: aucune
Devis d'étudeSignal candidat: Sans objet · Signal consensuel: Sans objet
GenreSignal candidat: Jeu de données · Signal consensuel: Jeu de données
Score de désaccord entre enseignants0,530
Score d'incertitude au seuil0,670

Scores du classifieur distillé par catégorie (deux têtes)

CatégorieCodexGemma
Métarecherche0,0260,126
Méta-épidémiologie (sens strict)0,0020,002
Méta-épidémiologie (sens large)0,0030,002
Bibliométrie0,0110,016
Études des sciences et des technologies0,0030,002
Communication savante0,0090,006
Science ouverte0,0040,006
Intégrité de la recherche0,0030,005
Charge utile insuffisante (le modèle a refusé de juger)0,5300,210

Scores machine (provisoires)

Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.

Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.

Tête enseignante Opus0,283
Tête enseignante GPT0,461
Écart entre enseignants0,178 · la distance entre les deux têtes enseignantes sur ce seul travail
Statut de validationscore_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découle

Classification

machine, non validée

Prédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.

Devis d'étudeSans objet
Domainenon disponible
GenreJeu de données

Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».

En bref

Citations7
Publié2017
Routes d'admission1
Résumé présentoui

Explorer davantage

Même revueResearch Ideas and OutcomesMême sujetCybercrime and Law Enforcement StudiesTravaux en français237 207