Academic Jobs - Home of Higher Ed Logo

A Formação de IA em Conteúdo Académico de Editoras Encontra Resistência e Possível Litigação

Postar uma história
12Opinião
Native advertising — guest articles from $400See packages
a poster on a wall
Photo by Dedale on Unsplash

O momento geralmente chega como um e-mail. Um pesquisador recebe uma nota de formulário de um editor de revista: o acordo do autor agora cobre aprendizado de máquina, mineração de dados e treinamento de modelo de idioma grande. A palavra 'incluindo' aparece antes de uma lista de usos que não existiam quando a revista publicou o trabalho pela primeira vez.

Essa questão mudou de caixas de entrada privadas para disputas públicas nos últimos dois anos. editores acadêmicos, enfrentando o crescimento da assinatura plana e o alto custo de manter plataformas de revistas, começaram a vender acesso a conteúdos acadêmicos para treinamento de IA. As empresas do outro lado desses acordos incluem a Microsoft e outros desenvolvedores construindo modelos de idiomas grandes, que precisam de uma enorme corpora de texto confiável para melhorar sua produção.

Os autores e as sociedades acadêmicas descrevem algo mais próximo de uma surpresa: o conteúdo carregado para os sistemas editoriais anos atrás está agora sendo empacotado como dados de treinamento, muitas vezes sob contratos que os autores nunca viram, com termos de royalties que permanecem incertos e prazos de opt-out enterrados nas configurações do portal.

Como funcionam os acordos

Taylor & Francis, de propriedade da Informa, tornou-se o exemplo mais visível em 2024, quando o The Bookseller relatou que a empresa tinha assinado um acordo de dados de IA com a Microsoft. A editora mais tarde disse que os autores poderiam optar antes de seu trabalho ser usado, mas muitos pesquisadores aprenderam sobre o arranjo através da imprensa em vez do editor.

Wiley discutiu receitas de licenciamento de IA em comunicações de investidores públicos, e a Cambridge University Press & Assessment publicou princípios dizendo que pode licenciar certos trabalhos acadêmicos para treinamento de IA, a menos que os autores optem.

Alguns editores disseram que os autores receberão uma parte das receitas de licenciamento. Outros trataram os arranjos como parte das operações gerais sem especificar a compensação do autor. Como o dinheiro é agregado e os acordos são confidenciais, os autores não têm maneira fácil de saber se seu artigo particular foi incluído, que modelo o usou, ou quanto um único artigo contribuiu.

a stack of books sitting on top of a wooden table

Photo by Jotform on Unsplash

Por que os pesquisadores estão recuando

OAutores da Guildadvertiu os editores contra tratar as cláusulas de IA como uma boilerplate de rotina.Sociedade dos AutoresEle pediu que os autores sejam solicitados consentimento explícito antes de seu trabalho entrar em um corpo de treinamento, e uma pesquisa da Sociedade de Licenciamento e Coleta de Autores descobriu que a maioria dos escritores acredita que eles devem ser perguntados e pagos quando seu trabalho é usado para treinar sistemas de IA.

Essa reação se moveu muito além das reclamações individuais.Como a AcademicJobs relatou em sua cobertura deautor backlash em AI licensing deals, várias revistas da sociedade descobriram que seus editores não tinham consultado conselhos editoriais ou enquadrado o acordo como uma questão operacional fora da governança acadêmica.

Os estudiosos das ciências humanas estão preocupados que uma ampla licença possa permitir que um modelo parafraseie ou reproduza um argumento sem atribuição. pesquisadores biomédicos estão preocupados com a forma como a corporação de treinamento lida com tabelas, relatórios de ensaios clínicos e arquivos de dados complementares anotados. defensores do acesso aberto apontam que muitas políticas de financiamento exigem que as obras sejam reutilizáveis sob licenças Creative Commons, e um acordo de treinamento comercial separado pode ficar desconfortável com essas promessas para leitores e contribuintes.

Muitas revistas próprias, mas licenciam as operações de publicação para grandes casas; eles estão agora perguntando se essas casas podem atacar os negócios de IA unilateralmente, e se os membros da sociedade devem ter uma palavra antes que o arquivo que construíram se torne um ativo de treinamento.

O que diz a lei e o que não diz

Nos Estados Unidos e no Reino Unido, o copyright protege a expressão específica em um artigo ou livro, não os fatos ou idéias subjacentes. Um editor que detém ou controla o copyright em uma obra pode geralmente licenciar que trabalhe para um novo uso, desde que o contrato o apoie. Mas muitos acordos de publicação mais antigos não mencionam grandes modelos de linguagem, aprendizado de máquina ou mineração de texto e dados. Os tribunais ainda não decidiram se uma concessão padrão de "todos os direitos eletrônicos" atinge o treinamento de IA, e os estudiosos jurídicos diferem sobre se o treinamento é uma reprodução, uma transformação ou uma atividade fora do pacote de direitos exclusivos inteiramente.

A União Europeia tem um caráter regulamentar mais restrito.Artigo 4.oDiretiva de Direitos de Autor da UEpermite a extração de texto e dados para fins comerciais, a menos que os titulares de direitos tenham reservado expressamente o direito de forma legível por máquina.Um editor ou autor que reserve direitos pode, portanto, optar pelo nível do próprio material, mas o efeito prático depende se a reserva é honrada a jusante por corretores de dados e desenvolvedores de modelos.

O litígio dos EUA tem até agora visado empresas de tecnologia em vez de editores. A Associação de Autores e escritores individuais processaram a OpenAI e outros, argumentando que o uso de coleções e livros não autorizados equivale a violação de direitos autorais. Esses casos não resolvem diretamente a questão de licenciamento de editores, mas seu resultado irá moldar o que uma licença de treinamento vale. Se os tribunais julgarem que o treinamento em obras protegidas por direitos autorais sem uma licença é um uso justo, o valor desses acordos de editores poderia enfraquecer.

Os autores que acreditam que um editor excedeu os direitos concedidos em um contrato de publicação podem processar por violação de contrato, procurar decisões declarativas, ou emitir cartas de pré-ação exigindo contabilização das receitas de licenciamento.

text

Photo by Brett Jordan on Unsplash

O problema do contrato escondido à vista

Olhe para um acordo de autor típico de 2012. Ele concede ao editor o direito de reproduzir, distribuir e sublicenciar a contribuição em todas as formas e meios de comunicação agora conhecidos ou desenvolvidos posteriormente. Um advogado do editor lerá essa cláusula como cobrindo treinamento de IA. Um autor a lerá como cobrindo livros eletrônicos e bancos de dados. Nem pode ser certo, porque nenhum tribunal interpretou a cláusula nesta configuração, e os contratos geralmente não dizem nada sobre dados de treinamento, atribuição ou revogação do autor.

Alguns contratos mais recentes tentam remover a ambiguidade. Taylor & Francis e Cambridge University Press introduziram cláusulas que se referem diretamente ao treinamento de IA e estabelecem opções de opt-out. Mas o enquadramento importa. Um sistema de opt-out coloca a carga no autor para monitorar os anúncios dos editores e responder por um prazo. Isso é um padrão familiar de acordos de transição de acesso aberto, e tende a amplificar as vozes que já entendem licenciamento, enquanto grupos mais silenciosos são inscritos por padrão.

Pesquisadores em instituições com escritórios de direitos autorais fortes começaram a pedir acordos de publicação de mestrado que reservem direitos de IA ao autor, a menos que negociados separadamente.Algumas universidades europeias agora aconselham os professores a adicionar um piloto aos contratos de revistas: o trabalho pode ser publicado na revista, mas o autor mantém o direito de controlar os usos comerciais de aprendizagem de máquina.

O que procurar em um acordo:

  • O contrato menciona modelos de idiomas grandes, aprendizado de máquina ou mineração de texto e dados?
  • O uso da IA é tratado como um direito separado que requer pagamento separado, ou dobrado em linguagem de sublicenciamento existente?
  • A exclusão aplica-se apenas a trabalhos futuros ou a arquivos já existentes no sistema do editor?
  • O que acontece com a cláusula se você recusar, e quanto tempo você tem que responder?

O que um escritório de pesquisa universitária pode fazer agora

Os escritórios de pesquisa universitários podem dar um passo concreto neste mês. Adicione uma única pergunta à sua lista de verificação de pré-publicação: este acordo menciona treinamento de IA ou aprendizado de máquina, e o que acontece se você recusar? Para muitos autores, a resposta será que o editor nunca levantou o problema. Para alguns, será uma caixa de verificação que eles perderam. Faça-o visível antes que o contrato seja assinado, não depois que o corpo de treinamento tenha sido construído.

A disputa é apenas em parte sobre os direitos autorais.É também sobre se os estudiosos sabem, e têm uma palavra em, o que acontece com o registro que eles passaram anos construindo.Os editores que tornam o arranjo legível em linguagem simples, com opções reais e uma parcela justa de receita, enfrentarão muito menos do escrutínio agora em seu caminho.

Retrato do Prof. Sophie Martinez
Sobre o autor

Prof. Sophie MartinezVeja o autor

Academic Jobs In House Author

Os reconhecimentos:

Discussão

De sorte em:

Seja o primeiro a comentar este artigo!

Você

Você será solicitado a entrar antes que seu comentário seja postado.

novo0 comments

Junte-se à nossa conversa!

Adicione seus comentários agora!

Tenha sua palavra

Nível de engajamento

Browse por Faculdade

Browse por assunto

Frequently Asked Questions

❓O que significa treinamento de IA de editoras em conteúdo acadêmico?

Significa que um editor concede licença de artigos de revistas, livros ou outras obras acadêmicas a uma empresa de tecnologia para que o material possa ser utilizado para treinar grandes modelos de linguagem, como os modelos GPT da OpenAI. O editor pode vender ou oferecer acesso ao texto e o modelo aprende padrões da escrita antes de produzir novo texto.

📚Quais editoras acadêmicas assinaram acordos de treinamento de IA?

A Taylor & Francis, parte da Informa, assinou um acordo de dados de IA com a Microsoft em 2024. A Wiley discutiu receita de licenciamento de IA com investidores e a Cambridge University Press & Assessment publicou princípios que permitem que algumas obras acadêmicas sejam licenciadas para treinamento de IA, a menos que os autores optem por não participar.

💰Os autores académicos recebem pagamento quando o seu trabalho é utilizado para treinamento de IA?

O pagamento varia e muitas vezes não é detalhado. Alguns editores disseram que os autores receberão uma parte da receita de licenciamento, enquanto outros não especificaram a compensação dos autores. Como os acordos são confidenciais, um autor normalmente não pode saber se um artigo específico foi utilizado ou qual foi o valor contribuído por um único artigo.

🚪Os autores podem optar por não participar no treino de IA nos acordos com os editores?

Alguns editores oferecem a possibilidade de optar por não participar, geralmente através de um portal de autores ou sistema de submissão. A opção de não participar pode aplicar-se apenas a trabalhos submetidos recentemente, pode exigir uma ação até uma data limite e pode não abranger conteúdo mais antigo já existente no arquivo do editor.

⚖️É legal que os editores licenciem conteúdo académico para treino de IA?

A resposta depende do contrato e do país. Nos Estados Unidos e no Reino Unido, um editor pode geralmente licenciar obras que possui ou controla, mas contratos mais antigos podem não abordar claramente a formação de IA. Na União Europeia, o Artigo 4.º da Diretiva sobre Direitos de Autor permite a mineração de texto e dados comerciais, a menos que os direitos sejam expressamente reservados.

🗣️O que os autores e as sociedades académicas estão dizendo sobre acordos de formação de IA?

A Authors Guild advertiu os editores contra o tratamento de licenças de IA como cláusulas contratuais rotineiras e a Sociedade de Autores do Reino Unido pediu consentimento explícito dos autores. Muitas sociedades científicas querem ter uma palavra a dizer antes de os jornais que possuem serem licenciados para empresas de tecnologia por seus parceiros editoriais.

🔓Os acordos de formação de IA entram em conflito com o acesso aberto ou as directrizes dos financiadores?

Podem coexistir de forma desconfortável. Alguns financiadores exigem que as obras sejam distribuídas sob licenças Creative Commons que permitam reutilização, enquanto um acordo comercial de formação separado pode impor restrições adicionais. Os autores devem verificar se os termos de IA de um editor entram em conflito com os termos anexados à versão de registo ou ao manuscrito aceite.

🏛️Os editores acadêmicos já foram processados por conteúdo de treinamento de IA?

Os processos mais proeminentes visaram empresas de tecnologia, como a OpenAI, e não os editores acadêmicos. Os litígios que envolvem os editores são mais prováveis de prosseguir como reclamações de violação de contrato ou contabilização prévia, pois a questão central é saber se o acordo de autor existente do editor abrangia o aprendizado de máquina.

🔍O que os investigadores devem procurar num contrato de publicação antes de assinar?

Procure menção explícita de formação de IA, aprendizagem automática, mineração de texto e dados, ou grandes modelos de linguagem. Verifique se o uso de IA está incluído na linguagem de sublicenciamento existente, se o pagamento é separado, se a opção de exclusão abrange trabalhos mais antigos e o que acontece se recusar. Adicione um anexo se a sua instituição exigir o seu consentimento para aprendizagem automática comercial.

🏫Como os gabinetes de investigação universitários podem ajudar os docentes com a licença de IA dos editores?

Os gabinetes de investigação podem adicionar uma única pergunta às listas de verificação pré-publicação: este acordo menciona formação de IA ou aprendizagem automática e o que acontece se recusar? Eles também podem manter um guia breve sobre cláusulas de IA de editores e aconselhar os autores a resolver a questão antes de a obra ser aceite, e não depois.