Academic Jobs - Home of Higher Ed Logo

Les éditeurs universitaires font face à la réaction négative des auteurs sur les accords relatifs aux données de formation de l'IA

Poster une histoire
60vues
A large pile of various self-help and business books scattered on a surface
Photo by Shiromani Kant on Unsplash

Les auteurs académiques n'ont pas appris sur l'accord de formation de Taylor & Francis AI à partir d'un supplément de contrat. Ils l'ont appris à partir de nouvelles commerciales. Le 19 juillet 2024, The Guardian a rapporté que l'éditeur, faisant partie de Informa, avait accordé une licence d'accès à un grand corps de son contenu de journal et de livre à Microsoft pour améliorer les systèmes d'IA. Le paiement initial était de 10 millions de dollars.

La réaction a été rapide et aiguë.La Société des auteurs a répondu que l'ampleur et le manque d'avertissement soulevaient des questions difficiles sur le consentement.Certains universitaires ont déclaré qu'ils refuseraient les futures demandes d'examen par les pairs pour l'éditeur.L'accord lui-même n'était pas unique; il est devenu le cas visible parce que l'argent a été divulgué dans un appel à l'investisseur et les auteurs ne l'étaient pas.

La révélation de 10 millions de dollars qui a brisé l'histoire

Le directeur général de Informa, Stephen Carter, a décrit le partenariat comme un arrangement d'accès aux données plutôt qu'une vente d'articles individuels.Taylor & Francis a déclaré que l'accord permettrait à Microsoft d'accéder à un dépôt de contenu protégé pour améliorer la pertinence et les performances de ses systèmes d'IA.

Le backlash avait un taux de base simple. La plupart des chercheurs qui publient dans des revues d'abonnement transfèrent le droit d'auteur ou accordent de larges licences exclusives à l'éditeur. Ils ne sont pas payés pour l'article. Ils ne sont souvent pas payés pour l'examen par les pairs. Lorsqu'un éditeur licencie ensuite le corpus résultant, ces auteurs voient un arrangement qui attribue toute la nouvelle valeur à l'éditeur et aucun contrôle à eux.

three white and red labeled boxes

Photo by Lala Azizli on Unsplash

À quoi ressemble réellement l'écart de consentement

Dans un sondage de 2023 de plus de 1 700 écrivains publiés, la Guilde des auteurs a rapporté qu'environ 90 pour cent ont déclaré que les écrivains devraient être indemnisés lorsque leur travail est utilisé pour former des systèmes d'IA génératifs.Le rapport du Guardian de juillet 2024 sur l'accord Taylor & FrancisLes éditeurs avaient une voie légale pour concéder des licences au contenu, et les auteurs n’avaient pas de voie comparable pour en savoir plus.

Une partie de la confusion est légale. Selon de nombreux accords d'édition sous abonnement, l'auteur transfère le droit d'auteur à l'éditeur pour la version finale publiée. L'éditeur peut alors conclure un contrat avec une société de technologie sans demander l'approbation de l'auteur. Le manuscrit accepté, cependant, peut être placé dans un dépôt institutionnel sous un ensemble de droits différent. Cette division signifie que le même article peut avoir plusieurs vies: la version finale de l'éditeur, la version acceptée par l'auteur dans un dépôt, une copie ouverte mandatée par le fondateur, et souvent une préimpression publiée avant l'examen. Chacune porte des règles différentes.

Une licence Creative Commons Attribution, connue sous le nom de CC BY, permet à quiconque de réutiliser l'œuvre à quelque fin que ce soit, y compris à des fins commerciales, tant que le crédit est accordé.Créativité FAQtraite la formation machine comme une forme de traitement qu'une licence CC peut permettre. Les auteurs qui ont choisi CC BY parce que leur financier l'a demandé supposent parfois qu'il arrête la réutilisation commerciale; il ne l'est pas.

Contre-argument des éditeurs : c’est un nouveau flux de licences

Du côté de l’éditeur, un accord de formation sur l’IA est une licence de base de données, pas un événement de royalties d’auteur. Informa et d’autres éditeurs ont dit aux investisseurs que la licence générative d’IA offre des revenus récurrents provenant de contenus qu’ils ont déjà investi dans la curation, la typographie, l’indexation et la protection.La librairie peut-êtreque l'accord Taylor & Francis a été compris en termes commerciaux comme un arrangement d'accès, comparable en mécanique à la façon dont les bibliothèques accordent des licences aux collections de texte complet plutôt que la façon dont les auteurs accordent des licences aux œuvres individuelles.

Les éditeurs soutiennent également que les auteurs bénéficient indirectement à travers une plate-forme d'édition plus stable et à travers des outils de découverte qui dépendent du même contenu.L'argument a un certain poids pour les petites sociétés qui comptent sur les revenus d'édition pour soutenir les revues.Il a moins de poids pour les auteurs individuels qui ne peuvent pas voir ce qui a été spécifiquement licencié, quand, ou sous quels termes.Le fossé implique de l'argent, mais le plus grand problème est l'absence d'un mécanisme de notification et de consentement standard avant la signature d'un accord.

Ce que cela signifie pour votre laboratoire

Une collaboratrice que j’appellerai « Dr. L » a publié trois articles avec le même journal d’abonnement sur une décennie. Lorsque l’histoire de Taylor & Francis s’est brisée, elle a vérifié ses accords d’auteur de chaque année. Les deux premiers ont transféré directement le droit d’auteur. Le troisième, d’un contrat plus récent, a accordé à l’éditeur une licence exclusive mais a inclus une clause d’apprentissage automatique qui n’avait pas paru dans les versions précédentes. Elle avait signé les trois sans remarquer le changement de formulation. L’éditeur avait tout le droit de concéder des licences à ces articles dans les termes qu’elle a acceptés. C’est la réalité pratique: la plupart des chercheurs ne suivent pas le langage

Avant la prochaine transaction atterrit dans votre domaine, vérifiez votre propre piste papier.

  • Recherchez le langage « formation à l’intelligence artificielle », « apprentissage automatique » ou « extraction de texte et de données », ainsi que la phrase « tous les médias connus ou développés par la suite » dans l’accord que vous avez signé.
  • Si vous avez publié l'accès ouvert sous CC BY, supposez que la licence autorise la réutilisation commerciale, y compris la formation à l'IA, sauf si l'avis de licence indique autrement.
  • Demandez à l'éditeur si les auteurs reçoivent une notification ou un paiement lorsque le portefeuille est sous licence et demandez une réponse écrite.
  • Gardez une copie de votre manuscrit accepté dans un dépôt où vous contrôlez la version, car votre sponsor peut vous avoir donné des droits que l’éditeur n’a pas mentionnés.

Ce qui vient ensuite : les contrats, les consortiums et une piste papier

Les universités luttent déjà des batailles séparées sur les contrats d’édition et les conditions d’accès ouvert.Litige entre les bibliothèques du Royaume-Uni et Elsevier sur les prix d'abonnementmontre comment les institutions peuvent exercer une pression lorsqu'elles négocient en tant que groupe, bien que la clause sur l'IA soit rarement le premier point de l'ordre du jour.Retractions de papier à l'échellequi a rendu la communication avec les auteurs plus défensive à travers le conseil.

Les éditeurs ont rapporté une augmentation des manuscrits citant des sources inexistantes ou générées par l'IA, un problème que l'organisme de commerce de l'édition STM a commencé à traiter à traversGuide de l’intégritéLe problème est différent de la licence de données de formation, mais les deux partagent une condition fondamentale: le texte généré par machine et le corps de lecture machine se développent tous les deux plus rapidement que les normes éditoriales qui les entourent.

Pour les chercheurs, l'étape immédiate est de ne pas abandonner les revues.Il s'agit de lire la langue de l'accord avant de soumettre et de poser la question que la plupart des auteurs ont sauté: 'Si vous licenciez cet article à une société de technologie, serai-je informé?' Si la réponse est non, c'est un point de données.

Portrait de Dr. Nathan Harlow
A propos de l'auteur

Dr. Nathan HarlowVoir auteur

Academic Jobs In House Author

Discussions

Sort par :

Soyez le premier à commenter cet article !

vous

Vous serez invité à vous connecter avant de publier votre commentaire.

Nouvelle0 comments

Rejoignez la conversation !

Ajoutez vos commentaires dès maintenant !

Avoir votre mot

Niveau d’engagement

Browse par faculté

Browse par sujet

Frequently Asked Questions

❓Qu'est-ce qui a déclenché la réaction des auteurs contre les éditeurs universitaires et les données de formation IA ?

En juillet 2024, des articles de presse ont révélé que Taylor & Francis, propriété d'Informa, avait concédé sous licence un grand corpus de contenu de revues et de livres à Microsoft pour la formation d'IA. Le paiement initial était estimé à 10 millions de dollars. Les auteurs universitaires ont déclaré qu'ils n'avaient pas été consultés, ce qui a suscité des critiques de la part de groupes tels que la Society of Authors et l'Authors Guild.

❓Taylor & Francis a-t-il informé les auteurs de l'accord Microsoft AI avant de le signer ?

Plusieurs reportages ont indiqué que les auteurs ont découvert l'information grâce à la couverture médiatique plutôt que par l'éditeur. Taylor & Francis a présenté l'accord comme un arrangement d'accès aux données, mais l'absence de notification est devenue la principale plainte.

❓Les auteurs de revues universitaires possèdent-ils généralement les droits d'auteur de leurs articles publiés ?

Dans de nombreuses revues à abonnement, les auteurs cèdent les droits d'auteur ou accordent une licence exclusive à l'éditeur. Une fois cela fait, l'éditeur peut concéder la version finale publiée sans l'accord explicite de l'auteur.

❓Les articles en accès libre peuvent-ils être utilisés pour la formation de l'IA sans autorisation ?

Oui, selon la licence. Une licence CC BY permet la réutilisation à des fins commerciales, y compris la réutilisation commerciale, tant que l'attribution est donnée. La foire aux questions de Creative Commons traite la formation de la machine comme une forme autorisée de traitement sous CC BY.

❓Que disent les éditeurs universitaires à propos des accords de formation de l'IA ?

Les éditeurs décrivent ces accords comme des licences de base de données et non comme des ventes au niveau de l'article. Ils soulignent les investissements dans la curation, l'indexation et la distribution, et ils soutiennent que la licence soutient la plateforme de publication.

❓Les auteurs peuvent-ils se désinscrire de la formation de l'IA une fois un article de revue publié ?

Cela dépend du contrat et de la licence. Pour les articles en accès payant où les droits d'auteur ont été cédés, l'éditeur contrôle généralement la licence. Les auteurs qui ont conservé leurs droits peuvent avoir la possibilité de s'opposer, mais doivent vérifier l'accord spécifique.

❓Quels éditeurs universitaires ont fait face à une réaction négative des auteurs concernant les données de formation de l'IA ?

Taylor & Francis est devenu le cas le plus visible après l'accord avec Microsoft. D'autres éditeurs ont suscité des questions de la part des organisations d'auteurs, mais la divulgation de Taylor & Francis est largement citée comme un point de départ.

❓La enquête de l'Authors Guild aborde-t-elle les opinions des auteurs universitaires sur la rémunération de l'IA ?

Une enquête de l'Authors Guild menée en 2023 a révélé que près de 90 pour cent des écrivains publiés estimaient que les auteurs devraient être indemnisés lorsque leur travail sert à former des IA génératives. L'enquête portait sur les auteurs dans leur ensemble, et non seulement sur les universitaires, mais le sentiment s'est répercuté dans les débats sur l'édition universitaire.

❓Que signifie une licence CC BY pour l'apprentissage automatique ?

La licence CC BY permet à quiconque de copier et de redistribuer le matériel dans n'importe quel support ou format, et de l'adapter à toute fin, avec attribution. Cela inclut l'extraction de texte et de données et la formation de modèles génératifs, sauf si un contrat séparé le stipule autrement.

❓Que doivent faire les chercheurs avant de soumettre leur prochain manuscrit ?

Lisez l'accord de publication pour le langage de l'IA, de l'apprentissage automatique ou de l'extraction de texte et de données. Demandez à l'éditeur si les auteurs seront informés des licences au niveau du portefeuille. Conservez le manuscrit accepté dans un référentiel institutionnel lorsque cela est possible.

❓Y a-t-il des changements juridiques ou politiques proposés pour la licence d'IA dans l'édition universitaire ?

Les organisations d'auteurs et certains consortiums de bibliothèques universitaires ont demandé des mécanismes de consentement, de notification et de compensation. Le débat politique est actif, bien que le langage contractuel standard ne soit pas encore établi.