MétaCan
Menu
Retour à la cohorte
Enregistrement W4407155798 · doi:10.1108/jices-05-2024-0052

The use of publicly available online texts in training AI: an ethical analysis of AI’s right to learn

2025· article· en· W4407155798 sur OpenAlexaff
Louai Rahal

Notice bibliographique

RevueJournal of Information Communication and Ethics in Society · 2025
Typearticle
Langueen
DomaineSocial Sciences
ThématiqueEthics and Social Impacts of AI
Établissements canadiensBecton Dickinson (Canada)
Organismes subventionnairesnon disponible
Mots-clésTraining (meteorology)Computer scienceArtificial intelligenceSociology

Résumé

récupéré en direct d'OpenAlex

Purpose This paper aims to discuss the ethical permissibility of using publicly available online texts in the training of AI. This practice has facilitated and accelerated the growth of AI technology, but it has also drawn accusations of exploiting authors and violating their intellectual property rights. Design/methodology/approach The discussion is based on the Kantian theory of ethics, a theory that is grounded in the duty to preserve and empower the autonomy of the human will. Findings Following from the duty to support human autonomy, the article makes two claims: First, AI should be granted the right to learn from public texts because the more AI learns, the better it assists humans in expanding their will. Second, AI’s right to learn should be conditional, not absolute. The article articulates three conditions that should be met prior to granting an AI system the right to learn from public texts: AI that uses public data must be freely available to the public, AI (and its developers) ought to educate the public on the uses and misuses of AI, and AI (and its developers) must remove personal information from the training data. Originality/value Under what conditions is it justifiable to use someone’s text without their permission? This very question is currently being examined in courts in the many lawsuits filed against AI companies. An ethical analysis of this question helps bridge the gap between the perspective of AI companies that claim to be using public texts for the public good and the perspectives accusing them of violating authors’ copyrights.

Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.

Comment cette classification a été obtenuedéplier

Prédiction distillée sur la base complète

Imitation des enseignants

Ni prévalence calibrée, ni vérité terrain. Validation humaine à venir. Apprise à partir de 10 348 étiquettes directes de Codex et de 10 348 étiquettes directes de Gemma. Le mode candidate est l'union des têtes enseignantes seuillées; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont ni des étiquettes humaines ni des étiquettes directes de modèles de pointe.

score de la tête « metaresearch » (Codex)0,016
score de la tête « metaresearch » (Gemma)0,008
Version: codex-gemma-dda1882f352aStatut de validation: machine_predicted_unvalidated
Catégories candidatesIntégrité de la recherche
Catégories consensuellesaucune
DomaineSignal candidat: aucune · Signal consensuel: aucune
Devis d'étudeSignal candidat: Qualitatif · Signal consensuel: aucune
GenreSignal candidat: Empirique · Signal consensuel: aucune
Score de désaccord entre enseignants0,583
Score d'incertitude au seuil0,999

Scores Codex et Gemma par catégorie

CatégorieCodexGemma
Métarecherche0,0160,008
Méta-épidémiologie (sens strict)0,0000,000
Méta-épidémiologie (sens large)0,0000,000
Bibliométrie0,0000,002
Études des sciences et des technologies0,0010,001
Communication savante0,0000,002
Science ouverte0,0000,000
Intégrité de la recherche0,0010,003
Charge utile insuffisante (le modèle a refusé de juger)0,0000,000

Scores machine (provisoires)

Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.

Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.

Tête enseignante Opus0,172
Tête enseignante GPT0,455
Écart entre enseignants0,283 · la distance entre les deux têtes enseignantes sur ce seul travail
Statut de validationscore_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découle

Classification

machine, non validée

Prédiction automatique; un appel candidat d’une seule tête enseignante, pas un consensus.

Devis d'étudeQualitatif
Domainenon disponible
GenreEmpirique

Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».

En bref

Citations0
Publié2025
Routes d'admission1
Résumé présentoui

Explorer davantage

Même revueJournal of Information Communication and Ethics in SocietyMême sujetEthics and Social Impacts of AITravaux en français237 207