Access and Advocacy: Text & Data Mining and DMCA §1201
Notice bibliographique
Résumé
Significant work in DH has focused on access, labor, and infrastructure. They fundamentally shape the field, from who is included to what we study (for example, see Graban et al 2019, McGrail et al 2022, and Losh and Wernimont 2018). Often less discussed is the legal systems that impact the field. Laws defining data use including ownership, access, circulation, and privacy shape the analytical possibilities and differ according to geography and nation state. In this article, we address the impact of a specific United States legal framework governing access to data and outline advocacy to change the legal code to facilitate DH research. We specifically discuss the Association for Computers and the Humanities (ACH) work to support a change in text and data mining policy by supporting an effort led by Samuelson Law, Technology & Public Policy Clinic and Authors Alliance. This policy, section 1201 of the US copyright code, imposes a set of restrictions on how people can use digital materials whose access is mediated using technical protection measures, including digital rights management (DRM) code—even when the use would otherwise be permitted by fair use. (Fair use in US copyright law is roughly equivalent to fair dealing in Canada, although inherently more open through not enumerating a specific list of exemptions.) By collaborating with one another and with legal practitioners, DH scholars can play a significant role in changing the legal regime that protects multinational corporations and limits humanities research. We end with a discussion of next steps and how US-based scholars can get involved in changing this legal landscape.D'importants travaux en DH se sont concentrés sur l'accès, l'emploI et l'infrastructure. Ils façonnent fondamentalement le domaine, de qui est inclus à ce que nous étudions (par exemple, voir Graban et al 2019, McGrail et al 2022, et Losh et Wernimont 2018). Les systèmes juridiques qui ont un impact sur le domaine sont souvent moins discutés. Les lois définissant l'utilisation des données, y compris la propriété, l'accès, la circulation et la confidentialité, façonnent les possibilités d'analyse et diffèrent en fonction de la géographie et de l'État-nation. Dans cet article, nous abordons l'impact d'un cadre juridique spécifique des États-Unis régissant l'accès aux données et décrivons les actions de plaidoyer visant à modifier le code juridique pour faciliter la recherche en DH. Nous discutons spécifiquement du travail de l'Association for Computers and the Humanities (ACH) pour soutenir un changement dans la politique d'exploration de textes et de données en soutenant un effort mené par Samuelson Law, Technology & Public Policy Clinic et Authors Alliance. Cette politique, section 1201 du code des droits d'auteur américain, impose un ensemble de restrictions sur la façon dont les gens peuvent utiliser les matériaux numériques dont l'accès est médiatisé par des mesures de protection technique, y compris le code de gestion des droits numériques (Digital Right Management ou DRM)—même lorsque l'utilisation serait autrement autorisée par l'utilisation équitable. (L'utilisation équitable dans la loi des États-Unis sur le droit d'auteur est à peu près équivalente à l'utilisation équitable au Canada, bien qu'elle soit intrinsèquement plus ouverte du fait qu'elle n'énumère pas une liste spécifique d'exemptions). En collaborant entre eux et avec les praticiens du droit, les chercheurs en sciences humaines peuvent jouer un rôle important dans la modification du régime juridique qui protège les multinationales et limite la recherche en sciences humaines. Nous terminerons par une discussion sur les prochaines étapes et sur la manière dont les chercheurs basés aux États-Unis peuvent s'impliquer dans la modification de ce paysage juridique.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction distillée sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Apprise à partir de 10 348 étiquettes directes de Codex et de 10 348 étiquettes directes de Gemma. Le mode candidate est l'union des têtes enseignantes seuillées; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont ni des étiquettes humaines ni des étiquettes directes de modèles de pointe.
Scores Codex et Gemma par catégorie
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,000 | 0,000 |
| Méta-épidémiologie (sens strict) | 0,000 | 0,000 |
| Méta-épidémiologie (sens large) | 0,000 | 0,000 |
| Bibliométrie | 0,000 | 0,000 |
| Études des sciences et des technologies | 0,000 | 0,000 |
| Communication savante | 0,001 | 0,004 |
| Science ouverte | 0,000 | 0,003 |
| Intégrité de la recherche | 0,000 | 0,000 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,000 | 0,000 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule tête enseignante, pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».