O momento geralmente chega como um e-mail. Um pesquisador recebe uma nota de formulário de um editor de revista: o acordo do autor agora cobre aprendizado de máquina, mineração de dados e treinamento de modelo de idioma grande. A palavra 'incluindo' aparece antes de uma lista de usos que não existiam quando a revista publicou o trabalho pela primeira vez.
Essa questão mudou de caixas de entrada privadas para disputas públicas nos últimos dois anos. editores acadêmicos, enfrentando o crescimento da assinatura plana e o alto custo de manter plataformas de revistas, começaram a vender acesso a conteúdos acadêmicos para treinamento de IA. As empresas do outro lado desses acordos incluem a Microsoft e outros desenvolvedores construindo modelos de idiomas grandes, que precisam de uma enorme corpora de texto confiável para melhorar sua produção.
Os autores e as sociedades acadêmicas descrevem algo mais próximo de uma surpresa: o conteúdo carregado para os sistemas editoriais anos atrás está agora sendo empacotado como dados de treinamento, muitas vezes sob contratos que os autores nunca viram, com termos de royalties que permanecem incertos e prazos de opt-out enterrados nas configurações do portal.
Como funcionam os acordos
Taylor & Francis, de propriedade da Informa, tornou-se o exemplo mais visível em 2024, quando o The Bookseller relatou que a empresa tinha assinado um acordo de dados de IA com a Microsoft. A editora mais tarde disse que os autores poderiam optar antes de seu trabalho ser usado, mas muitos pesquisadores aprenderam sobre o arranjo através da imprensa em vez do editor.
Wiley discutiu receitas de licenciamento de IA em comunicações de investidores públicos, e a Cambridge University Press & Assessment publicou princípios dizendo que pode licenciar certos trabalhos acadêmicos para treinamento de IA, a menos que os autores optem.
Alguns editores disseram que os autores receberão uma parte das receitas de licenciamento. Outros trataram os arranjos como parte das operações gerais sem especificar a compensação do autor. Como o dinheiro é agregado e os acordos são confidenciais, os autores não têm maneira fácil de saber se seu artigo particular foi incluído, que modelo o usou, ou quanto um único artigo contribuiu.
Por que os pesquisadores estão recuando
OAutores da Guildadvertiu os editores contra tratar as cláusulas de IA como uma boilerplate de rotina.Sociedade dos AutoresEle pediu que os autores sejam solicitados consentimento explícito antes de seu trabalho entrar em um corpo de treinamento, e uma pesquisa da Sociedade de Licenciamento e Coleta de Autores descobriu que a maioria dos escritores acredita que eles devem ser perguntados e pagos quando seu trabalho é usado para treinar sistemas de IA.
Essa reação se moveu muito além das reclamações individuais.Como a AcademicJobs relatou em sua cobertura deautor backlash em AI licensing deals, várias revistas da sociedade descobriram que seus editores não tinham consultado conselhos editoriais ou enquadrado o acordo como uma questão operacional fora da governança acadêmica.
Os estudiosos das ciências humanas estão preocupados que uma ampla licença possa permitir que um modelo parafraseie ou reproduza um argumento sem atribuição. pesquisadores biomédicos estão preocupados com a forma como a corporação de treinamento lida com tabelas, relatórios de ensaios clínicos e arquivos de dados complementares anotados. defensores do acesso aberto apontam que muitas políticas de financiamento exigem que as obras sejam reutilizáveis sob licenças Creative Commons, e um acordo de treinamento comercial separado pode ficar desconfortável com essas promessas para leitores e contribuintes.
Muitas revistas próprias, mas licenciam as operações de publicação para grandes casas; eles estão agora perguntando se essas casas podem atacar os negócios de IA unilateralmente, e se os membros da sociedade devem ter uma palavra antes que o arquivo que construíram se torne um ativo de treinamento.
O que diz a lei e o que não diz
Nos Estados Unidos e no Reino Unido, o copyright protege a expressão específica em um artigo ou livro, não os fatos ou idéias subjacentes. Um editor que detém ou controla o copyright em uma obra pode geralmente licenciar que trabalhe para um novo uso, desde que o contrato o apoie. Mas muitos acordos de publicação mais antigos não mencionam grandes modelos de linguagem, aprendizado de máquina ou mineração de texto e dados. Os tribunais ainda não decidiram se uma concessão padrão de "todos os direitos eletrônicos" atinge o treinamento de IA, e os estudiosos jurídicos diferem sobre se o treinamento é uma reprodução, uma transformação ou uma atividade fora do pacote de direitos exclusivos inteiramente.
A União Europeia tem um caráter regulamentar mais restrito.Artigo 4.oDiretiva de Direitos de Autor da UEpermite a extração de texto e dados para fins comerciais, a menos que os titulares de direitos tenham reservado expressamente o direito de forma legível por máquina.Um editor ou autor que reserve direitos pode, portanto, optar pelo nível do próprio material, mas o efeito prático depende se a reserva é honrada a jusante por corretores de dados e desenvolvedores de modelos.
O litígio dos EUA tem até agora visado empresas de tecnologia em vez de editores. A Associação de Autores e escritores individuais processaram a OpenAI e outros, argumentando que o uso de coleções e livros não autorizados equivale a violação de direitos autorais. Esses casos não resolvem diretamente a questão de licenciamento de editores, mas seu resultado irá moldar o que uma licença de treinamento vale. Se os tribunais julgarem que o treinamento em obras protegidas por direitos autorais sem uma licença é um uso justo, o valor desses acordos de editores poderia enfraquecer.
Os autores que acreditam que um editor excedeu os direitos concedidos em um contrato de publicação podem processar por violação de contrato, procurar decisões declarativas, ou emitir cartas de pré-ação exigindo contabilização das receitas de licenciamento.
Photo by Brett Jordan on Unsplash
O problema do contrato escondido à vista
Olhe para um acordo de autor típico de 2012. Ele concede ao editor o direito de reproduzir, distribuir e sublicenciar a contribuição em todas as formas e meios de comunicação agora conhecidos ou desenvolvidos posteriormente. Um advogado do editor lerá essa cláusula como cobrindo treinamento de IA. Um autor a lerá como cobrindo livros eletrônicos e bancos de dados. Nem pode ser certo, porque nenhum tribunal interpretou a cláusula nesta configuração, e os contratos geralmente não dizem nada sobre dados de treinamento, atribuição ou revogação do autor.
Alguns contratos mais recentes tentam remover a ambiguidade. Taylor & Francis e Cambridge University Press introduziram cláusulas que se referem diretamente ao treinamento de IA e estabelecem opções de opt-out. Mas o enquadramento importa. Um sistema de opt-out coloca a carga no autor para monitorar os anúncios dos editores e responder por um prazo. Isso é um padrão familiar de acordos de transição de acesso aberto, e tende a amplificar as vozes que já entendem licenciamento, enquanto grupos mais silenciosos são inscritos por padrão.
Pesquisadores em instituições com escritórios de direitos autorais fortes começaram a pedir acordos de publicação de mestrado que reservem direitos de IA ao autor, a menos que negociados separadamente.Algumas universidades europeias agora aconselham os professores a adicionar um piloto aos contratos de revistas: o trabalho pode ser publicado na revista, mas o autor mantém o direito de controlar os usos comerciais de aprendizagem de máquina.
O que procurar em um acordo:
- O contrato menciona modelos de idiomas grandes, aprendizado de máquina ou mineração de texto e dados?
- O uso da IA é tratado como um direito separado que requer pagamento separado, ou dobrado em linguagem de sublicenciamento existente?
- A exclusão aplica-se apenas a trabalhos futuros ou a arquivos já existentes no sistema do editor?
- O que acontece com a cláusula se você recusar, e quanto tempo você tem que responder?
O que um escritório de pesquisa universitária pode fazer agora
Os escritórios de pesquisa universitários podem dar um passo concreto neste mês. Adicione uma única pergunta à sua lista de verificação de pré-publicação: este acordo menciona treinamento de IA ou aprendizado de máquina, e o que acontece se você recusar? Para muitos autores, a resposta será que o editor nunca levantou o problema. Para alguns, será uma caixa de verificação que eles perderam. Faça-o visível antes que o contrato seja assinado, não depois que o corpo de treinamento tenha sido construído.
A disputa é apenas em parte sobre os direitos autorais.É também sobre se os estudiosos sabem, e têm uma palavra em, o que acontece com o registro que eles passaram anos construindo.Os editores que tornam o arranjo legível em linguagem simples, com opções reais e uma parcela justa de receita, enfrentarão muito menos do escrutínio agora em seu caminho.
