Academic Jobs - Home of Higher Ed Logo

L'entraînement de l'IA des éditeurs sur le contenu universitaire fait l'objet d'un examen et d'une éventuelle litige

Poster une histoire
36vues
Native advertising — guest articles from $400See packages
a poster on a wall
Photo by Dedale on Unsplash

Un chercheur reçoit une note de formulaire d'un éditeur de revue : l'accord de l'auteur couvre désormais l'apprentissage automatique, l'extraction de données et la formation des grands modèles linguistiques. Le mot "incluant" apparaît avant une liste d'usages qui n'existaient pas lorsque la revue a publié le travail pour la première fois.

Ces deux dernières années, les éditeurs universitaires, confrontés à la croissance de l'abonnement et au coût élevé de la maintenance de plateformes de revues, ont commencé à vendre l'accès au contenu académique pour la formation en matière d'IA. Les entreprises de l'autre côté de ces accords comprennent Microsoft et d'autres développeurs qui construisent de grands modèles linguistiques, qui ont besoin d'un grand corps de texte fiable pour améliorer leur production.

Les auteurs et les sociétés académiques décrivent quelque chose de plus proche d'une surprise: le contenu téléchargé dans les systèmes éditoriaux il y a des années est maintenant emballé comme des données de formation, souvent sous des contrats que les auteurs n'ont jamais vus, avec des termes de royalties qui restent incertains et des délais d'opt-out enterrés dans les paramètres du portail.

Comment fonctionnent les accords

Taylor & Francis, détenu par Informa, est devenu l'exemple le plus visible en 2024, lorsque The Bookseller a rapporté que la société avait signé un accord de données sur l'IA avec Microsoft. L'éditeur a plus tard déclaré que les auteurs pouvaient se désinscrire avant que leur travail ne soit utilisé, mais de nombreux chercheurs ont appris l'arrangement par la presse plutôt que par l'éditeur.

Wiley a discuté des revenus des licences d'IA dans les communications des investisseurs publics, et Cambridge University Press & Assessment a publié des principes qui disent qu'il peut concéder des licences à certaines œuvres académiques pour la formation à l'IA à moins que les auteurs ne s'opposent.

Les structures de paiement sont rarement publiques. Certains éditeurs ont déclaré que les auteurs recevront une part des revenus de licence. D'autres ont traité les arrangements comme faisant partie des opérations générales sans préciser l'indemnisation des auteurs. Parce que l'argent est agrégé et que les accords sont confidentiels, les auteurs n'ont pas de moyen facile de savoir si leur article particulier a été inclus, quel modèle l'a utilisé, ou combien un seul papier a contribué.

a stack of books sitting on top of a wooden table

Photo by Jotform on Unsplash

Pourquoi les chercheurs repoussent

LeAuteur Guilda mis en garde les éditeurs contre le traitement des clauses d'IA comme une boilerplate de routine.Société des auteursIl a demandé aux auteurs de demander un consentement explicite avant que leur travail entre dans un corpus de formation, et une enquête de la Société d'autorisation et de collecte a révélé que la plupart des écrivains pensent qu'ils devraient être demandés et payés lorsque leur travail est utilisé pour former des systèmes d'IA.

Cette réaction a bien dépassé les plaintes individuelles.Comme AcademicJobs a rapporté dans sa couverture deAuteur Backlash sur les licences d'IAPlusieurs journaux de la société ont découvert que leurs éditeurs n'avaient pas consulté les conseils d'édition ou n'avaient pas encadré l'accord comme une affaire opérationnelle en dehors de la gouvernance académique.

Les chercheurs en sciences humaines s'inquiètent qu'une large licence puisse permettre à un modèle de paraphraser ou de reproduire un argument sans attribution. les chercheurs biomédicaux s'inquiètent de la façon dont le corps de formation traite les tables, les rapports d'essais cliniques et les fichiers de données complémentaires annotés.

Beaucoup de sociétés ont leurs propres journaux, mais autorisent les opérations de publication à de grandes maisons; ils se demandent maintenant si ces maisons peuvent frapper les affaires d'IA unilatéralement, et si les membres de la société devraient avoir un mot à dire avant que l'archive qu'ils ont construite ne devienne un atout de formation.

Ce que dit la loi et ce qu'elle ne fait pas

Aux États-Unis et au Royaume-Uni, le droit d’auteur protège l’expression spécifique d’un article ou d’un livre, et non les faits ou idées sous-jacents. Un éditeur qui possède ou contrôle le droit d’auteur dans une œuvre peut généralement concéder une licence qui fonctionne pour un nouvel usage, à condition que le contrat le soutienne.Mais de nombreux anciens accords d’édition ne mentionnent pas les grands modèles linguistiques, l’apprentissage automatique ou l’extraction de textes et de données.Les tribunaux n’ont pas encore décidé si une concession standard de « tous les droits électroniques » atteint la formation en matière d’IA, et les juristes diffèrent quant à savoir si la formation est une reproduction

L'Union européenne dispose d'un cadre juridique plus étroit.Article 4Directive européenne sur le droit d'auteurautorise l'extraction de texte et de données à des fins commerciales, à moins que les titulaires de droits n'aient expressément réservé le droit de manière lisible par machine.Un éditeur ou un auteur qui réserve les droits peut donc se désinscrire au niveau du matériel lui-même, mais l'effet pratique dépend si la réserve est honorée en aval par les courtiers de données et les développeurs de modèles.

Le litige américain a jusqu'à présent ciblé des entreprises technologiques plutôt que des éditeurs. La Guilde des auteurs et des écrivains individuels ont poursuivi OpenAI et d'autres, en affirmant que l'utilisation de collections et de livres non autorisés équivaut à une violation du droit d'auteur. Ces cas ne règlent pas directement la question de la licence d'éditeur, mais leur résultat va façonner la valeur d'une licence de formation. Si les tribunaux considèrent que la formation sur les œuvres protégées par le droit d'auteur sans licence est un usage équitable, la valeur de ces accords d'édition pourrait s'affaiblir.

Les auteurs qui croient qu’un éditeur a dépassé les droits accordés dans un contrat d’édition peuvent poursuivre pour violation de contrat, demander des décisions déclaratives, ou émettre des lettres de pré-action exigeant la comptabilisation des recettes de licence.

text

Photo by Brett Jordan on Unsplash

Le problème du contrat caché à la vue

Regardez un accord d'auteur typique de 2012. Il accorde à l'éditeur le droit de reproduire, distribuer et sous-licencier la contribution dans toutes les formes et les médias maintenant connus ou développés ultérieurement. Un avocat de l'éditeur lisera cette clause comme couvrant la formation sur l'IA. Un auteur la lisera comme couvrant les livres électroniques et les bases de données. Ni ne peut être certain, car aucun tribunal n'a interprété la clause dans ce cadre, et les contrats ne disent généralement rien sur les données de formation, l'attribution ou la révocation de l'auteur.

Certains contrats plus récents tentent de supprimer l'ambiguïté. Taylor & Francis et Cambridge University Press ont introduit des clauses qui se réfèrent directement à la formation en AI et établissent des choix d'opt-out. Mais le framing compte. Un système d'opt-out place le fardeau sur l'auteur pour surveiller les annonces des éditeurs et répondre par un délai. C'est un modèle familier des accords de transition d'accès ouvert, et il a tendance à amplifier les voix qui comprennent déjà la licence alors que des groupes plus silencieux sont inscrits par défaut.

Des chercheurs d'institutions avec de fortes bureaux de droits d'auteur ont commencé à demander des accords d'édition maîtres qui réservent les droits d'IA à l'auteur, sauf négociation séparée.Certaines universités européennes conseillent maintenant aux professeurs d'ajouter un pilote aux contrats de revues: le travail peut être publié dans la revue, mais l'auteur conserve le droit de contrôler les utilisations commerciales de l'apprentissage automatique.

Ce qu’il faut rechercher dans un contrat :

  • Le contrat mentionne-t-il les grands modèles linguistiques, l’apprentissage automatique ou l’extraction de texte et de données ?
  • L’utilisation de l’IA est-elle traitée comme un droit distinct nécessitant un paiement séparé, ou est-elle pliée dans un langage de sous-licences existant?
  • L’opt-out s’applique-t-il uniquement aux œuvres futures ou aux archives déjà dans le système de l’éditeur ?
  • Que se passe-t-il avec la clause si vous refusez, et combien de temps avez-vous à répondre?

Ce qu'un bureau de recherche universitaire peut faire maintenant

Les bureaux de recherche universitaires peuvent prendre une étape concrète ce mois-ci. Ajoutez une seule question à votre liste de vérification de pré-publiation: cet accord mentionne-t-il la formation à l'IA ou l'apprentissage automatique, et que se passe-t-il si vous refusez? Pour de nombreux auteurs, la réponse sera que l'éditeur n'a jamais soulevé le problème. Pour certains, ce sera une case de vérification qu'ils ont manquée.

Il s'agit également de savoir si les chercheurs apprennent, et ont un mot à dire, ce qui arrive au dossier qu'ils ont passé des années à construire.Les éditeurs qui rendent l'arrangement lisible en langage simple, avec des opt-outs réels et une part équitable des recettes, seront confrontés à beaucoup moins de contrôle maintenant leur chemin.

Portrait de Prof. Sophie Martinez
A propos de l'auteur

Prof. Sophie MartinezVoir auteur

Academic Jobs In House Author

Les reconnaissances :

Discussions

Sort par :

Soyez le premier à commenter cet article !

vous

Vous serez invité à vous connecter avant de publier votre commentaire.

Nouvelle0 comments

Rejoignez la conversation !

Ajoutez vos commentaires dès maintenant !

Avoir votre mot

Niveau d’engagement

Browse par faculté

Browse par sujet

Frequently Asked Questions

❓Qu'est-ce que la formation de l'IA des éditeurs sur le contenu universitaire ?

Cela signifie qu'un éditeur concède une licence à une société de technologie pour utiliser des articles de revues, des livres ou d'autres œuvres universitaires pour entraîner des modèles de langage de grande envergure, tels que les modèles GPT d'OpenAI. L'éditeur peut vendre ou proposer un accès groupé au texte, et le modèle apprend des modèles à partir de l'écriture avant de produire un nouveau texte.

📚Quels éditeurs universitaires ont signé des accords de formation en IA ?

Taylor & Francis, qui fait partie d'Informa, a signé un accord de données IA avec Microsoft en 2024. Wiley a discuté des revenus de licence IA avec les investisseurs, et Cambridge University Press & Assessment a publié des principes permettant à certaines œuvres universitaires d'être concédées sous licence pour la formation en IA, sauf si les auteurs s'y opposent.

💰Les auteurs universitaires sont-ils rémunérés lorsque leur travail est utilisé pour la formation de l'IA ?

Le paiement varie et n'est souvent pas détaillé. Certains éditeurs ont indiqué que les auteurs recevront une part des revenus de licence, tandis que d'autres n'ont pas précisé la rémunération des auteurs. Puisque les accords sont confidentiels, un auteur ne peut généralement pas savoir si un article particulier a été utilisé ou quelle valeur un article unique a contribuée.

🚪Les auteurs peuvent-ils se désinscrire de la formation de l'IA dans le cadre d'accords avec les éditeurs ?

Certains éditeurs proposent une option de désinscription, généralement via un portail d'auteur ou un système de soumission. La désinscription peut ne s'appliquer qu'aux travaux nouvellement soumis, nécessiter une action avant une date limite et ne pas couvrir le contenu plus ancien déjà archivé par l'éditeur.

⚖️Est-il légal pour les éditeurs de concéder des licences pour la formation de l'IA à partir de contenus universitaires ?

La réponse dépend du contrat et du pays. Aux États-Unis et au Royaume-Uni, un éditeur peut généralement concéder des licences pour les œuvres qu'il possède ou contrôle, mais les contrats plus anciens peuvent ne pas couvrir clairement la formation à l'IA. Dans l'Union européenne, l'article 4 de la directive sur le droit d'auteur permet l'exploitation commerciale de textes et de données à des fins d'exploration, sauf si les droits sont expressément réservés.

🗣️Que disent les auteurs et les sociétés savantes au sujet des accords de formation à l'IA ?

L'Authors Guild a mis les éditeurs en garde contre le traitement des licences d'IA comme clauses de style standard, et la Society of Authors du Royaume-Uni a demandé un consentement explicite des auteurs. De nombreuses sociétés savantes souhaitent avoir leur mot à dire avant que les revues qu'elles possèdent ne soient licenciées à des sociétés technologiques par leurs partenaires éditoriaux.

🔓Les accords de formation d'IA entrent-ils en conflit avec l'accès ouvert ou les mandats des financeurs ?

Ils peuvent cohabiter de manière inconfortable. Certains financeurs exigent que les œuvres soient diffusées sous des licences Creative Commons qui permettent la réutilisation, tandis qu'un accord commercial de formation distinct peut imposer des contraintes supplémentaires. Les auteurs doivent vérifier si les conditions d'IA d'un éditeur entrent en conflit avec les conditions attachées à la version de référence ou au manuscrit accepté.

🏛️Des éditeurs universitaires ont-ils été poursuivis en justice pour du contenu de formation d'IA ?

Les poursuites les plus importantes ont visé des sociétés technologiques comme OpenAI, et non des éditeurs universitaires. Les litiges impliquant les éditeurs sont plus susceptibles de se poursuivre sous forme de réclamations pour rupture de contrat ou de comptes préalables, car la question centrale est de savoir si l'accord d'édition existant couvrait l'apprentissage automatique.

🔍Qu'est-ce que les chercheurs doivent rechercher dans un contrat de publication avant de le signer ?

Recherchez une mention explicite de la formation de l'IA, de l'apprentissage automatique, du text and data mining ou des grands modèles de langage. Vérifiez si l'utilisation de l'IA est incluse dans le langage de sous-licence existant, si le paiement est séparé, si l'option de refus couvre les travaux plus anciens et ce qui se passe si vous refusez. Ajoutez un avenant si votre institution exige votre consentement pour l'apprentissage automatique commercial.

🏫Comment les bureaux de recherche universitaires peuvent-ils aider les enseignants-chercheurs avec la licence AI des éditeurs ?

Les bureaux de recherche peuvent ajouter une seule question aux listes de contrôle préalable à la publication : cet accord mentionne-t-il la formation à l'IA ou l'apprentissage automatique, et que se passe-t-il si vous refusez ? Ils peuvent également maintenir un guide concis sur les clauses d'IA des éditeurs et conseiller aux auteurs de résoudre le problème avant l'acceptation de l'œuvre, et non après.