The use of publicly available online texts in training AI: an ethical analysis of AI’s right to learn
Notice bibliographique
Résumé
Purpose This paper aims to discuss the ethical permissibility of using publicly available online texts in the training of AI. This practice has facilitated and accelerated the growth of AI technology, but it has also drawn accusations of exploiting authors and violating their intellectual property rights. Design/methodology/approach The discussion is based on the Kantian theory of ethics, a theory that is grounded in the duty to preserve and empower the autonomy of the human will. Findings Following from the duty to support human autonomy, the article makes two claims: First, AI should be granted the right to learn from public texts because the more AI learns, the better it assists humans in expanding their will. Second, AI’s right to learn should be conditional, not absolute. The article articulates three conditions that should be met prior to granting an AI system the right to learn from public texts: AI that uses public data must be freely available to the public, AI (and its developers) ought to educate the public on the uses and misuses of AI, and AI (and its developers) must remove personal information from the training data. Originality/value Under what conditions is it justifiable to use someone’s text without their permission? This very question is currently being examined in courts in the many lawsuits filed against AI companies. An ethical analysis of this question helps bridge the gap between the perspective of AI companies that claim to be using public texts for the public good and the perspectives accusing them of violating authors’ copyrights.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction machine sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.
Scores du classifieur distillé par catégorie (deux têtes)
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,087 | 0,160 |
| Méta-épidémiologie (sens strict) | 0,001 | 0,001 |
| Méta-épidémiologie (sens large) | 0,001 | 0,001 |
| Bibliométrie | 0,003 | 0,002 |
| Études des sciences et des technologies | 0,012 | 0,100 |
| Communication savante | 0,020 | 0,028 |
| Science ouverte | 0,003 | 0,014 |
| Intégrité de la recherche | 0,016 | 0,015 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,006 | 0,001 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».