Un chercheur reçoit une note de formulaire d'un éditeur de revue : l'accord de l'auteur couvre désormais l'apprentissage automatique, l'extraction de données et la formation des grands modèles linguistiques. Le mot "incluant" apparaît avant une liste d'usages qui n'existaient pas lorsque la revue a publié le travail pour la première fois.
Ces deux dernières années, les éditeurs universitaires, confrontés à la croissance de l'abonnement et au coût élevé de la maintenance de plateformes de revues, ont commencé à vendre l'accès au contenu académique pour la formation en matière d'IA. Les entreprises de l'autre côté de ces accords comprennent Microsoft et d'autres développeurs qui construisent de grands modèles linguistiques, qui ont besoin d'un grand corps de texte fiable pour améliorer leur production.
Les auteurs et les sociétés académiques décrivent quelque chose de plus proche d'une surprise: le contenu téléchargé dans les systèmes éditoriaux il y a des années est maintenant emballé comme des données de formation, souvent sous des contrats que les auteurs n'ont jamais vus, avec des termes de royalties qui restent incertains et des délais d'opt-out enterrés dans les paramètres du portail.
Comment fonctionnent les accords
Taylor & Francis, détenu par Informa, est devenu l'exemple le plus visible en 2024, lorsque The Bookseller a rapporté que la société avait signé un accord de données sur l'IA avec Microsoft. L'éditeur a plus tard déclaré que les auteurs pouvaient se désinscrire avant que leur travail ne soit utilisé, mais de nombreux chercheurs ont appris l'arrangement par la presse plutôt que par l'éditeur.
Wiley a discuté des revenus des licences d'IA dans les communications des investisseurs publics, et Cambridge University Press & Assessment a publié des principes qui disent qu'il peut concéder des licences à certaines œuvres académiques pour la formation à l'IA à moins que les auteurs ne s'opposent.
Les structures de paiement sont rarement publiques. Certains éditeurs ont déclaré que les auteurs recevront une part des revenus de licence. D'autres ont traité les arrangements comme faisant partie des opérations générales sans préciser l'indemnisation des auteurs. Parce que l'argent est agrégé et que les accords sont confidentiels, les auteurs n'ont pas de moyen facile de savoir si leur article particulier a été inclus, quel modèle l'a utilisé, ou combien un seul papier a contribué.
Pourquoi les chercheurs repoussent
LeAuteur Guilda mis en garde les éditeurs contre le traitement des clauses d'IA comme une boilerplate de routine.Société des auteursIl a demandé aux auteurs de demander un consentement explicite avant que leur travail entre dans un corpus de formation, et une enquête de la Société d'autorisation et de collecte a révélé que la plupart des écrivains pensent qu'ils devraient être demandés et payés lorsque leur travail est utilisé pour former des systèmes d'IA.
Cette réaction a bien dépassé les plaintes individuelles.Comme AcademicJobs a rapporté dans sa couverture deAuteur Backlash sur les licences d'IAPlusieurs journaux de la société ont découvert que leurs éditeurs n'avaient pas consulté les conseils d'édition ou n'avaient pas encadré l'accord comme une affaire opérationnelle en dehors de la gouvernance académique.
Les chercheurs en sciences humaines s'inquiètent qu'une large licence puisse permettre à un modèle de paraphraser ou de reproduire un argument sans attribution. les chercheurs biomédicaux s'inquiètent de la façon dont le corps de formation traite les tables, les rapports d'essais cliniques et les fichiers de données complémentaires annotés.
Beaucoup de sociétés ont leurs propres journaux, mais autorisent les opérations de publication à de grandes maisons; ils se demandent maintenant si ces maisons peuvent frapper les affaires d'IA unilatéralement, et si les membres de la société devraient avoir un mot à dire avant que l'archive qu'ils ont construite ne devienne un atout de formation.
Ce que dit la loi et ce qu'elle ne fait pas
Aux États-Unis et au Royaume-Uni, le droit d’auteur protège l’expression spécifique d’un article ou d’un livre, et non les faits ou idées sous-jacents. Un éditeur qui possède ou contrôle le droit d’auteur dans une œuvre peut généralement concéder une licence qui fonctionne pour un nouvel usage, à condition que le contrat le soutienne.Mais de nombreux anciens accords d’édition ne mentionnent pas les grands modèles linguistiques, l’apprentissage automatique ou l’extraction de textes et de données.Les tribunaux n’ont pas encore décidé si une concession standard de « tous les droits électroniques » atteint la formation en matière d’IA, et les juristes diffèrent quant à savoir si la formation est une reproduction
L'Union européenne dispose d'un cadre juridique plus étroit.Article 4Directive européenne sur le droit d'auteurautorise l'extraction de texte et de données à des fins commerciales, à moins que les titulaires de droits n'aient expressément réservé le droit de manière lisible par machine.Un éditeur ou un auteur qui réserve les droits peut donc se désinscrire au niveau du matériel lui-même, mais l'effet pratique dépend si la réserve est honorée en aval par les courtiers de données et les développeurs de modèles.
Le litige américain a jusqu'à présent ciblé des entreprises technologiques plutôt que des éditeurs. La Guilde des auteurs et des écrivains individuels ont poursuivi OpenAI et d'autres, en affirmant que l'utilisation de collections et de livres non autorisés équivaut à une violation du droit d'auteur. Ces cas ne règlent pas directement la question de la licence d'éditeur, mais leur résultat va façonner la valeur d'une licence de formation. Si les tribunaux considèrent que la formation sur les œuvres protégées par le droit d'auteur sans licence est un usage équitable, la valeur de ces accords d'édition pourrait s'affaiblir.
Les auteurs qui croient qu’un éditeur a dépassé les droits accordés dans un contrat d’édition peuvent poursuivre pour violation de contrat, demander des décisions déclaratives, ou émettre des lettres de pré-action exigeant la comptabilisation des recettes de licence.
Photo by Brett Jordan on Unsplash
Le problème du contrat caché à la vue
Regardez un accord d'auteur typique de 2012. Il accorde à l'éditeur le droit de reproduire, distribuer et sous-licencier la contribution dans toutes les formes et les médias maintenant connus ou développés ultérieurement. Un avocat de l'éditeur lisera cette clause comme couvrant la formation sur l'IA. Un auteur la lisera comme couvrant les livres électroniques et les bases de données. Ni ne peut être certain, car aucun tribunal n'a interprété la clause dans ce cadre, et les contrats ne disent généralement rien sur les données de formation, l'attribution ou la révocation de l'auteur.
Certains contrats plus récents tentent de supprimer l'ambiguïté. Taylor & Francis et Cambridge University Press ont introduit des clauses qui se réfèrent directement à la formation en AI et établissent des choix d'opt-out. Mais le framing compte. Un système d'opt-out place le fardeau sur l'auteur pour surveiller les annonces des éditeurs et répondre par un délai. C'est un modèle familier des accords de transition d'accès ouvert, et il a tendance à amplifier les voix qui comprennent déjà la licence alors que des groupes plus silencieux sont inscrits par défaut.
Des chercheurs d'institutions avec de fortes bureaux de droits d'auteur ont commencé à demander des accords d'édition maîtres qui réservent les droits d'IA à l'auteur, sauf négociation séparée.Certaines universités européennes conseillent maintenant aux professeurs d'ajouter un pilote aux contrats de revues: le travail peut être publié dans la revue, mais l'auteur conserve le droit de contrôler les utilisations commerciales de l'apprentissage automatique.
Ce qu’il faut rechercher dans un contrat :
- Le contrat mentionne-t-il les grands modèles linguistiques, l’apprentissage automatique ou l’extraction de texte et de données ?
- L’utilisation de l’IA est-elle traitée comme un droit distinct nécessitant un paiement séparé, ou est-elle pliée dans un langage de sous-licences existant?
- L’opt-out s’applique-t-il uniquement aux œuvres futures ou aux archives déjà dans le système de l’éditeur ?
- Que se passe-t-il avec la clause si vous refusez, et combien de temps avez-vous à répondre?
Ce qu'un bureau de recherche universitaire peut faire maintenant
Les bureaux de recherche universitaires peuvent prendre une étape concrète ce mois-ci. Ajoutez une seule question à votre liste de vérification de pré-publiation: cet accord mentionne-t-il la formation à l'IA ou l'apprentissage automatique, et que se passe-t-il si vous refusez? Pour de nombreux auteurs, la réponse sera que l'éditeur n'a jamais soulevé le problème. Pour certains, ce sera une case de vérification qu'ils ont manquée.
Il s'agit également de savoir si les chercheurs apprennent, et ont un mot à dire, ce qui arrive au dossier qu'ils ont passé des années à construire.Les éditeurs qui rendent l'arrangement lisible en langage simple, avec des opt-outs réels et une part équitable des recettes, seront confrontés à beaucoup moins de contrôle maintenant leur chemin.
