A descoberta mais previsível no ensino superior agora é que os alunos usam IA generativa. O menos previsível é que as universidades pararam de fingir que podem escrever uma única regra para a integração de IA e políticas de integridade acadêmica. A velha máquina de integridade correu em um roteiro compartilhado: plágio é o uso não autorizado de palavras ou idéias de outra pessoa. A IA generativa quebrou esse roteiro porque a ferramenta faz a montagem enquanto o aluno fornece o convite, e nenhuma das duas disciplinas desenha a linha no mesmo lugar.
O que está emergindo em vez disso é um patchwork, às vezes dentro de um edifício. Um curso de química permite a IA para codificar scripts; um seminário de história proíbe-o para redação de ensaios. A administração central pede ao corpo docente para relatar suas escolhas em uma caixa de currículo ninguém verifica. Essa fragmentação, mais do que qualquer escândalo único, é a verdadeira história de política de 2023 a 2026.
Um pacote global de regras, não uma única política
Turnitin ligou seu indicador de escrita de IA em abril de 2023, prometendo uma pontuação de confiança que significaria texto provavelmente produzido por um grande modelo de idioma. Em agosto daquele ano, a Universidade de Vanderbilt desligou o recurso para novas apresentações de estudantes, uma das primeiras universidades de pesquisa a fazê-lo publicamente. Até setembro de 2023, a UNESCO tinha emitido uma orientação global sobre a IA geradora na educação e pesquisa, e o Russell Group, que representa 24 universidades do Reino Unido intensivas em pesquisa, já tinha publicado cinco princípios compartilhados que tratavam a alfabetização de IA como parte do currículo, em vez de uma ameaça a ela.
A divisão entre esses movimentos conta a história. O vendedor ofereceu detecção. Uma universidade recusou. Os órgãos do setor pediram princípio, não proibição. Mesmo as primeiras proibições foram desiguais: Sciences Po em Paris restringiram o ChatGPT em avaliações sem autorização prévia em janeiro de 2023, enquanto outras instituições gastaram esse semestre escrevendo orientação em vez de regras. O resultado não é um consenso; é uma trégua negociada que difere de seminário para seminário.
Photo by Sasun Bughdaryan on Unsplash
Aqui está a captura: a detecção é a articulação fraca
As ferramentas que pareciam ser a espinha dorsal da aplicação resultaram ser a parte menos confiável da pilha. Os detectores devolvem um número, e um número se sente autorizado. A evidência diz o contrário. Em um estudo de 2023 liderado por pesquisadores da Universidade de Stanford e publicado em Patterns, sete detectores GPT amplamente usados classificaram mal 61 por cento dos 91 ensaios TOEFL escritos por falantes de inglês não nativos como gerados por IA. O mesmo estudo fez um ponto que cada painel de conduta deve ler: os falsos positivos não caem uniformemente; eles aterram mais difícil em escritores cujo inglês não corresponde aos dados de treinamento do modelo.
Foi uma demonstração de que a taxa de erro está concentrada entre os alunos menos propensos a ter poder institucional para empurrar para trás.
Uma análise teórica separada de cientistas de computação da Universidade de Maryland argumentou que a detecção confiável de texto gerado por IA não é apenas difícil, mas fundamentalmente instável à medida que os modelos melhoram. Isso não significa que as instituições possam ignorar o abuso.Estudo de detector-bias conduzido por StanfordE oAnálise de Maryland dos limites do detectortornaram-se as duas peças de evidência mais frequentemente citadas nos debates do campus sobre se manter as ferramentas ligadas.
A própria orientação de Turnitin diz que a pontuação deve informar uma investigação, não concluir uma.No entanto, a pontuação muitas vezes chega na caixa de entrada de um instrutor com o mesmo peso visual que um relatório de semelhança, e que a lacuna entre orientação e hábito é onde a maioria dos erros de conduta errada começam.
O que as universidades realmente mudaram no papel
Ao longo do patchwork, quatro posições continuam aparecendo: restrição dura, uso condicional com divulgação, delegação de curso por curso e redesenho de avaliação.
| Instituição ou grupo | Datas | Posição |
|---|---|---|
| Ciência Po | Janeiro de 2023 | Restringir o ChatGPT nas avaliações, a menos que um professor o permita explicitamente. |
| Turimão | Abril de 2023 | Lançou um indicador de escrita de IA para instituições usando sua ferramenta de semelhança. |
| Universidades do Grupo Russell | Julho 2023 | Publicou cinco princípios que apoiam a alfabetização de IA e a tomada de decisão em nível de curso. |
| Universidade de Vanderbilt | Agosto de 2023 | Detector de IA de Turnitin para novas submissões, citando preocupações de confiabilidade. |
| da Unesco | Setembro de 2023 | Diretrizes emitidas que incentivam o uso centrado no ser humano e inclusivo com uma responsabilidade clara. |
Quando Turnitin ligou o detector, a empresa disse que cerca de 3 por cento dos papéis estudantis em sua primeira amostra mostraram 80 por cento ou mais de texto escrito por IA. Uma pequena porcentagem em um grande denominador ainda significa milhares de estudantes flagged, e que aritmética empurrou muitos campi para procedimentos de conversação-primeiro.
Depois desses movimentos iniciais, as perguntas mais difíceis mudaram para o design de avaliação.As instituições que mantiveram o detector muitas vezes o associaram a um processo: uma pontuação marcada desencadeou uma conversa, não uma carga automática.A Universidade de Glasgow, por exemplo, publicou uma orientação exigindo que os alunos declarassem como usavam a IA geradora e informassem o pessoal quando o uso não autorizado constituiria uma conduta incorreta.Documento de Orientação da UNESCOpermanece uma referência útil porque liga a política à inclusão, à proteção de dados e à necessidade de revisão humana, em vez de julgamento algorítmico.
Photo by Markus Winkler on Unsplash
Hype versus realidade: um mapa de pontuação
Quatro alegações impulsionaram a conversa.Nenhum sobreviveu ao contato com a prática do campus inalterada.
- A reivindicação:Os detectores de IA podem identificar o trabalho gerado por IA com alta precisão.A realidade:Eles produzem uma pontuação de confiança que muda com as atualizações do modelo e classifica mal a escrita não nativa em inglês em altas taxas, razão pela qual várias instituições se recusam a usar a pontuação como evidência.
- A reivindicação:As universidades agora têm políticas claras e uniformes de IA.A realidade:As políticas são claras no nível de um curso ou departamento individual, e contraditórias em todos eles; o padrão é um conjunto de decisões locais.
- A reivindicação:A proibição da IA geradora protegerá a integridade da avaliação.A realidade:As proibições de borda são quase inaplicáveis porque as mesmas ferramentas são incorporadas em processadores de texto e motores de busca, e a detecção não pode apoiar a aplicação de forma confiável.
- A reivindicação:Permitir o uso de IA causará uma onda de ghostwriting sem desafios.A realidade:O problema mais comum é a assistência não declarada em escala, que é um problema de divulgação, não um problema de detecção.
As universidades que tratam a questão como um problema de divulgação gastam sua energia em novos formatos de avaliação e instruções claras.
Sobre o que será o próximo ciclo político
Se o primeiro ciclo de políticas era sobre detecção, o segundo é sobre evidências. Os painéis de conduta precisam de um padrão de prova que não se aplique a um algoritmo proprietário que ninguém pode inspeccionar. A faculdade precisa de projetos de avaliação que recompensem o trabalho que uma IA não pode fazer sozinha, e eles precisam de tempo para redesenhá-los.
O problema nunca foi o detector. É os quinze minutos por ensaio marcado que ninguém orçou. Uma pontuação chega, um aluno responde com seu histórico de edição, e um instrutor que já ensina quatro cursos é solicitado a pesar um número proprietário contra uma explicação humana. documentos de política que ignoram esses quinze minutos são teatro.
Para acadêmicos olhando para universidades que estão contratando, o teste prático é simples. Pergunte o que acontece quando um detector marca o ensaio de um aluno. Uma boa resposta descreve uma conversa e um segundo leitor. Uma resposta ruim descreve uma pontuação de limiar. Os autores liderados por Stanford do estudo de detector-bias colocam o aviso claramente: falsos positivos correm o risco de penalizar os próprios escritores que as ferramentas são destinadas a proteger.
