El hallazgo más predecible en la educación superior en este momento es que los estudiantes utilizan la IA generativa. El menos predecible es que las universidades han dejado de pretender que pueden escribir una única regla para la integración de IA y las políticas de integridad académica. La vieja máquina de integridad funcionó en un guión compartido: el plagio es el uso no autorizado de las palabras o ideas de otra persona.
Lo que está surgiendo en su lugar es un patchwork, a veces dentro de un edificio. Un curso de química permite a la IA codificar scripts; un seminario de historia lo prohíbe para redactar ensayos. La administración central pide a la facultad que informe sus elecciones en una caja de plan de estudios que nadie verifica. Esa fragmentación, más que cualquier escándalo único, es la historia política real de 2023 a 2026.
Un patchwork global de reglas, no una única política
Turnitin activó su indicador de escritura de IA en abril de 2023, prometiendo una puntuación de confianza que marcaría el texto probablemente producido por un modelo de lenguaje grande. En agosto de ese año, la Universidad de Vanderbilt apagó la función para las nuevas presentaciones de estudiantes, una de las primeras universidades de investigación para hacerlo públicamente. Para septiembre de 2023, la UNESCO había emitido una guía global sobre la IA generativa en educación y investigación, y el Grupo Russell, que representa a 24 universidades británicas de investigación intensiva, ya había publicado cinco principios compartidos que trataban la alfabetización de IA como parte del plan de estudios en lugar de una amenaza para él.
La división entre esos movimientos cuenta la historia. El vendedor ofreció la detección. Una universidad rechazó. Los órganos del sector pidieron principio, no prohibición. Incluso las prohibiciones tempranas fueron desiguales: Sciences Po en París restringió ChatGPT en evaluaciones sin permiso previo en enero de 2023, mientras que otras instituciones pasaron ese semestre escribiendo guía en lugar de reglas. El resultado no es un consenso; es un armisticio negociado que difiere de seminario a seminario.
Photo by Sasun Bughdaryan on Unsplash
Aquí está la captura: la detección es la articulación débil
Las herramientas que parecían la columna vertebral de la ejecución se han demostrado ser la parte menos confiable de la pila. Los detectores devuelven un número, y un número se siente autoritario. La evidencia dice lo contrario. En un estudio de 2023 liderado por investigadores de la Universidad de Stanford y publicado en Patterns, siete detectores GPT ampliamente utilizados clasificaron mal el 61 por ciento de los 91 ensayos TOEFL escritos por hablantes no nativos de inglés como generados por IA. El mismo estudio hizo un punto en que cada panel de conducta debería leer: los falsos positivos no caen uniformemente; aterrizan más duro en escritores cuyo inglés no coincide con los datos de formación del modelo.
Es por eso que el 61 por ciento de los hallazgos ha viajado hasta ahora.No era una afirmación de que todas las acusaciones están equivocadas.Fue una demostración de que la tasa de error está concentrada entre los estudiantes menos propensos a tener poder institucional para empujar atrás.
Un análisis teórico separado de científicos informáticos de la Universidad de Maryland argumentó que la detección confiable de texto generado por IA no es sólo difícil, sino fundamentalmente inestable a medida que los modelos mejoran. Esto no significa que las instituciones puedan ignorar el mal uso.Estudio de detector-bias dirigido por StanfordY elAnálisis de Maryland de los límites del detectorSe han convertido en las dos pruebas más frecuentemente citadas en los debates del campus sobre si mantener las herramientas activadas.
Sin embargo, la puntuación a menudo llega a la carpeta de correo de un instructor con el mismo peso visual que un informe de similitud, y que la brecha entre la orientación y el hábito es donde comienzan la mayoría de los errores de mala conducta.
Lo que las universidades cambiaron en el papel
A lo largo del patchwork, cuatro posiciones siguen apareciendo: restricción dura, uso condicional con divulgación, delegación de curso a curso y rediseño de evaluación.
| Institución o grupo | Fecha | Posición |
|---|---|---|
| Ciencia Po | enero 2023 | Restringir ChatGPT en las evaluaciones a menos que un conferenciante lo permitiera explícitamente. |
| Turnería | abril de 2023 | Lanzó un indicador de escritura de IA para instituciones utilizando su herramienta de similitud. |
| Universidades del Grupo Russell | Julio 2023 | Publicó cinco principios que apoyan la alfabetización de IA y la toma de decisiones a nivel de curso. |
| Universidad de Vanderbilt | Agosto de 2023 | Detector de inteligencia artificial de Turnitin para nuevos envíos, citando preocupaciones de fiabilidad. |
| La UNESCO | Septiembre 2023 | Guía emitida que insta a un uso centrado en el ser humano e incluyente con una clara responsabilidad. |
Cuando Turnitin encendió el detector, la compañía dijo que alrededor del 3 por ciento de los documentos estudiantiles en su primera muestra mostraban el 80 por ciento o más de texto escrito por IA. Un pequeño porcentaje en un denominador grande todavía significa miles de estudiantes emblemáticos, y que la aritmética empujó a muchos campus hacia los procedimientos de primera conversación.
Después de esos primeros movimientos, las preguntas más difíciles se trasladaron al diseño de evaluación. Las instituciones que mantenían el detector a menudo lo asociaron con un proceso: una puntuación marcada desencadenó una conversación, no una carga automática.La Universidad de Glasgow, por ejemplo, publicó una guía que exige a los estudiantes que declaren cómo usaron la IA generativa y dijeran al personal cuando el uso no autorizado constituiría una mala conducta.Guía de la UNESCOsigue siendo una referencia útil porque conecta la política con la inclusión, la protección de datos y la necesidad de revisión humana en lugar de juicio algorítmico.
Photo by Markus Winkler on Unsplash
Hype versus Realidad: una tarjeta de puntuación
Cuatro afirmaciones han impulsado la conversación. Ninguno ha sobrevivido el contacto con la práctica del campus sin cambios.
- La reclamación:Los detectores de IA pueden identificar el trabajo generado por IA con alta precisión.La realidad:Producen una puntuación de confianza que cambia con las actualizaciones del modelo y clasifica mal la escritura no nativa en inglés a altas tasas, por lo que varias instituciones se niegan a usar la puntuación como evidencia.
- La reclamación:Las universidades ahora tienen políticas claras y uniformes de IA.La realidad:Las políticas son claras a nivel de un curso o departamento individual, y contradictorias en todos ellos; el estándar es un conjunto de decisiones locales.
- La reclamación:Prohibir la IA generativa protegerá la integridad de la evaluación.La realidad:Las prohibiciones en blanco son casi inaplicables porque las mismas herramientas están incorporadas en procesadores de texto y motores de búsqueda, y la detección no puede apoyar de manera fiable la ejecución.
- La reclamación:Permitir el uso de la IA causará una ola de ghostwriting sin desafíos.La realidad:El problema más común es la asistencia no declarada a escala, que es un problema de divulgación, no un problema de detección.
Las universidades que tratan el problema como un problema de divulgación gastan su energía en nuevos formatos de evaluación y instrucciones claras.
¿De qué será el próximo ciclo político?
Si el primer ciclo de políticas se refería a la detección, el segundo se refería a la evidencia.Los paneles de conducción necesitan un estándar de prueba que no se apoye en un algoritmo propietario que nadie puede inspeccionar.La facultad necesita diseños de evaluación que recompensen el trabajo que una IA no puede hacer sola, y necesitan tiempo para rediseñarlos.
El problema nunca fue el detector. Es los quince minutos por ensayo que nadie presupuesta.Una puntuación llega, un estudiante responde con su historial de edición, y un instructor que ya enseña cuatro cursos se le pide que ponga un número propietario contra una explicación humana.
Para los académicos que miran las universidades que están contratando, la prueba práctica es simple. Pregunta qué sucede cuando un detector marca el ensayo de un estudiante. Una buena respuesta describe una conversación y un segundo lector. Una mala respuesta describe una puntuación de umbral. Los autores del estudio de detector-bias liderados por Stanford pusieron la advertencia claramente: los falsos positivos corren el riesgo de penalizar a los propios escritores las herramientas están destinadas a proteger.
