The use of publicly available online texts in training AI: an ethical analysis of AI’s right to learn
Notice bibliographique
Résumé
Purpose This paper aims to discuss the ethical permissibility of using publicly available online texts in the training of AI. This practice has facilitated and accelerated the growth of AI technology, but it has also drawn accusations of exploiting authors and violating their intellectual property rights. Design/methodology/approach The discussion is based on the Kantian theory of ethics, a theory that is grounded in the duty to preserve and empower the autonomy of the human will. Findings Following from the duty to support human autonomy, the article makes two claims: First, AI should be granted the right to learn from public texts because the more AI learns, the better it assists humans in expanding their will. Second, AI’s right to learn should be conditional, not absolute. The article articulates three conditions that should be met prior to granting an AI system the right to learn from public texts: AI that uses public data must be freely available to the public, AI (and its developers) ought to educate the public on the uses and misuses of AI, and AI (and its developers) must remove personal information from the training data. Originality/value Under what conditions is it justifiable to use someone’s text without their permission? This very question is currently being examined in courts in the many lawsuits filed against AI companies. An ethical analysis of this question helps bridge the gap between the perspective of AI companies that claim to be using public texts for the public good and the perspectives accusing them of violating authors’ copyrights.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction distillée sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Apprise à partir de 10 348 étiquettes directes de Codex et de 10 348 étiquettes directes de Gemma. Le mode candidate est l'union des têtes enseignantes seuillées; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont ni des étiquettes humaines ni des étiquettes directes de modèles de pointe.
Scores Codex et Gemma par catégorie
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,016 | 0,008 |
| Méta-épidémiologie (sens strict) | 0,000 | 0,000 |
| Méta-épidémiologie (sens large) | 0,000 | 0,000 |
| Bibliométrie | 0,000 | 0,002 |
| Études des sciences et des technologies | 0,001 | 0,001 |
| Communication savante | 0,000 | 0,002 |
| Science ouverte | 0,000 | 0,000 |
| Intégrité de la recherche | 0,001 | 0,003 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,000 | 0,000 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule tête enseignante, pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».