El momento suele llegar como un correo electrónico.Un investigador recibe una nota de formulario de un editor de revista: el acuerdo del autor ahora cubre el aprendizaje automático, la minería de datos y el entrenamiento de modelos de idioma de gran tamaño.La palabra 'incluyendo' aparece antes de una lista de usos que no existían cuando la revista publicó el trabajo por primera vez.El autor tiene una pregunta: ¿acabo de licenciar mi beca para entrenar a un AI, y por qué nadie preguntó primero?
Los editores académicos, que se enfrentan al crecimiento de la suscripción plana y al alto costo de mantener plataformas de revistas, han comenzado a vender el acceso a contenidos académicos para la formación de IA. Las compañías del otro lado de esos acuerdos incluyen a Microsoft y otros desarrolladores construyendo modelos de idiomas grandes, que necesitan una enorme corpora de texto confiable para mejorar su producción.
Los autores y las sociedades académicas describen algo más cercano a una sorpresa: el contenido cargado a los sistemas editoriales hace años ahora está siendo empacado como datos de formación, a menudo bajo contratos que los autores nunca vieron, con términos de licencia que permanecen inciertos y plazos de exclusión enterrados en las configuraciones del portal.
Cómo funcionan los acuerdos
Taylor & Francis, propiedad de Informa, se convirtió en el ejemplo más visible en 2024 cuando The Bookseller informó que la compañía había firmado un acuerdo de datos de IA con Microsoft. El editor más tarde dijo que los autores podrían optar por no utilizar su trabajo, pero muchos investigadores aprendieron del arreglo a través de la prensa en lugar del editor.
Wiley ha discutido los ingresos de la licencia de IA en las comunicaciones de los inversores públicos, y Cambridge University Press & Evaluation ha publicado principios que dicen que puede licenciar ciertas obras académicas para la formación de IA a menos que los autores opten por salir.
Algunos editores han dicho que los autores recibirán una parte de los ingresos de licencia. Otros han tratado los arreglos como parte de las operaciones generales sin especificar la compensación del autor. Debido a que el dinero es agregado y los acuerdos son confidenciales, los autores no tienen una manera fácil de saber si su artículo particular fue incluido, qué modelo lo usó, o cuánto contribuyó un solo papel.
Por qué los investigadores están empujando hacia atrás
ElAutores de Guildha advertido a los editores contra tratar las cláusulas de IA como una boilerplate de rutina.Sociedad de AutoresHa pedido a los autores que se les pida el consentimiento explícito antes de que su trabajo entre en un corpus de capacitación, y una encuesta de la Sociedad de Licenciamiento y Colección de Autores encontró que la mayoría de los escritores creen que deben ser preguntados y pagados cuando su trabajo se utiliza para entrenar sistemas de IA.
Esta reacción ha ido mucho más allá de las quejas individuales.Como informó AcademicJobs en su cobertura deAutor backlash en licencias de AI, varias revistas de la sociedad descubrieron que sus editores no habían consultado los consejos de redacción o habían enmarcado el acuerdo como un asunto operativo fuera de la gobernanza académica.
Los estudiosos de humanidades se preocupan de que una amplia licencia pudiera permitir a un modelo parafrasear o reproducir un argumento sin atribuir. investigadores biomédicos se preocupan de cómo la corporación de capacitación maneja tablas, informes de ensayos clínicos y archivos de datos complementarios anotados. defensores del acceso abierto señalan que muchas políticas de financiamiento requieren que las obras sean reutilizables bajo licencias Creative Commons, y un acuerdo de capacitación comercial separado puede estar incómodo con esas promesas para los lectores y los contribuyentes.
Muchas sociedades aprendidas tienen su propia participación. muchas revistas propias, pero licencian las operaciones de publicación a las grandes casas; ahora se preguntan si esas casas pueden atacar los acuerdos de IA unilateralmente, y si los miembros de la sociedad deben tener una palabra antes de que el archivo que construyeron se convierta en un activo de formación.
Lo que dice la ley y lo que no
En los Estados Unidos y el Reino Unido, el copyright protege la expresión específica en un artículo o libro, no los hechos o ideas subyacentes. Un editor que posee o controla el copyright en una obra puede generalmente licenciar que trabaje para un nuevo uso, siempre que el contrato lo apoye. Pero muchos acuerdos de publicación anteriores no mencionan grandes modelos de idiomas, aprendizaje automático o extracción de texto y datos. Los tribunales aún no han decidido si una concesión estándar de "todos los derechos electrónicos" alcanza la capacitación de IA, y los académicos del derecho difieren en si la capacitación es una reproducción, una transformación o una actividad fuera del conjunto de derechos exclusivos por completo.
La Unión Europea tiene un escudo de armas más estrecho.Artículo 4Directiva Europea de Derechos de Autorpermite la extracción de texto y datos con fines comerciales, a menos que los titulares de derechos hayan reservado expresamente el derecho de una manera legible por máquina.Un editor o autor que reserva los derechos puede, por lo tanto, optar por no participar en el nivel del material mismo, pero el efecto práctico depende de si la reserva es honrada a continuación por los intermediarios de datos y los desarrolladores de modelos.
El litigio estadounidense ha dirigido hasta ahora a empresas de tecnología en lugar de a editores. La Guardia de Autores y escritores individuales han demandado a OpenAI y a otros, argumentando que el uso de colecciones y libros no autorizados equivale a la violación de derechos de autor. Estos casos no resuelven directamente la cuestión de la licencia de editores, pero su resultado dará forma a lo que vale una licencia de formación. Si los tribunales sostienen que la formación en obras protegidas por derechos de autor sin una licencia es un uso justo, el valor de estos acuerdos de editores podría debilitarse.
Los autores que creen que un editor ha sobrepasado los derechos otorgados en un acuerdo de publicación pueden demandar por violación de contrato, buscar decisiones declarativas, o emitir cartas pre-acción que exijan contabilizar los ingresos de la licencia. Debido a que muchos acuerdos se rigen por leyes nacionales diferentes y contienen cláusulas de arbitraje, cualquier disputa es más probable que se resuelva como una serie de reclamaciones privadas que como una acción de clase limpia.
Photo by Brett Jordan on Unsplash
El problema del contrato oculto a la vista
Vea un acuerdo de autor típico de 2012. Se otorga al editor el derecho de reproducir, distribuir y sublicenciar la contribución en todas las formas y medios ahora conocidos o posteriormente desarrollados. El abogado de un editor leerá esa cláusula como cubriendo la formación de IA. Un autor la leerá como cubriendo libros electrónicos y bases de datos. Ni siquiera puede estar seguro, porque ningún tribunal ha interpretado la cláusula en este entorno, y los contratos generalmente no dicen nada sobre datos de formación, atribución o revocación del autor.
Algunos contratos más recientes intentan eliminar la ambigüedad. Taylor & Francis y Cambridge University Press han introducido cláusulas que se refieren directamente a la formación de IA y establecen opciones de opt-out. Pero el framing importa. Un sistema de opt-out coloca la carga en el autor para monitorear los anuncios de los editores y responder por un plazo. Esto es un patrón familiar de los acuerdos de transición de acceso abierto, y tiende a amplificar las voces que ya entienden la licencia mientras que los grupos más silenciosos se inscriben por defecto.
Investigadores de instituciones con fuertes oficinas de derechos de autor han comenzado a pedir acuerdos de publicación de maestría que reserven los derechos de IA al autor a menos que se negocien por separado.Algunas universidades europeas ahora aconsejan a la facultad que añada un piloto a los contratos de revistas: el trabajo puede ser publicado en la revista, pero el autor mantiene el derecho de controlar los usos comerciales del aprendizaje automático.
Qué buscar en un acuerdo:
- ¿El contrato menciona modelos de idiomas grandes, aprendizaje automático o extracción de texto y datos?
- ¿Es el uso de la IA tratado como un derecho separado que requiere un pago separado, o plegado en un lenguaje de sublicencia existente?
- ¿Se aplica la exclusión sólo a obras futuras, o a archivos ya existentes en el sistema del editor?
- ¿Qué ocurre con la cláusula si usted rechaza, y cuánto tiempo tiene que responder?
Qué puede hacer una universidad de investigación ahora
Las oficinas de investigación universitarias pueden dar un paso concreto este mes. Agregue una sola pregunta a su lista de verificación de pre-publicación: ¿este acuerdo menciona la formación de IA o el aprendizaje automático, y qué sucede si usted rechaza? Para muchos autores la respuesta será que el editor nunca ha planteado el problema. Para algunos será una caja de verificación que han perdido. Hazlo visible antes de que el contrato sea firmado, no después de que se haya construido el corpus de formación.
La controversia es solo en parte sobre los derechos de autor. También se trata de si los estudiosos saben, y tienen una palabra en, lo que sucede con el registro que pasaron años construyendo.Los editores que hacen el arreglo legible en lenguaje simple, con opciones reales y una parte justa de los ingresos, se enfrentarán a mucho menos de la inspección que ahora se dirige a su camino.
