La découverte la plus prévisible dans l'enseignement supérieur en ce moment est que les étudiants utilisent l'IA générative. L'une moins prévisible est que les universités ont cessé de prétendre qu'elles peuvent écrire une seule règle pour l'intégration de l'IA et les politiques d'intégrité académique. La vieille machine d'intégrité a fonctionné sur un script partagé: le plagiat est l'utilisation non autorisée des mots ou des idées d'une autre personne.
Ce qui émerge au lieu de cela est un patchwork, parfois à l'intérieur d'un bâtiment. Un cours de chimie permet à l'IA de coder des scripts; un séminaire d'histoire l'interdit pour la rédaction d'essai. L'administration centrale demande à la faculté de signaler leurs choix dans une boîte de schéma que personne ne vérifie. Cette fragmentation, plus que n'importe quel scandale, est l'histoire politique réelle de 2023 à 2026.
Un patchwork mondial de règles, pas une politique unique
Turnitin a activé son indicateur d'écriture d'IA en avril 2023, promettant un score de confiance qui marquerait probablement le texte produit par un grand modèle de langue. En août de cette année, l'Université Vanderbilt a désactivé la fonctionnalité pour les nouvelles soumissions d'étudiants, l'une des premières universités de recherche à le faire publiquement. En septembre 2023, l'UNESCO avait publié une orientation mondiale sur l'IA générative dans l'éducation et la recherche, et le groupe Russell, qui représente 24 universités britanniques de recherche intensive, avait déjà publié cinq principes partagés qui traitaient l'alphabétisation d'IA comme faisant partie du programme plutôt qu'une menace pour elle.
La division entre ces mouvements raconte l'histoire. Le vendeur a offert la détection. Une université a refusé. Les organismes du secteur ont demandé un principe, pas une interdiction. Même les interdictions antérieures étaient inégales: Sciences Po à Paris a restreint ChatGPT dans les évaluations sans autorisation préalable en janvier 2023, tandis que d'autres institutions ont passé ce semestre à écrire des directives au lieu de règles. Le résultat n'est pas un consensus; c'est une trêve négociée qui diffère de séminaire à séminaire.
Photo by Sasun Bughdaryan on Unsplash
Voici la capture: la détection est l'articulation faible
Les outils qui ressemblaient à la colonne vertébrale de l'application se sont révélés être la partie la moins fiable de la pile. Les détecteurs renvoient un nombre, et un nombre se sent autorisé. Les preuves disent autrement. Dans une étude de 2023 menée par des chercheurs de l'Université de Stanford et publiée dans Patterns, sept détecteurs GPT largement utilisés ont mal classé 61 pour cent des 91 essais TOEFL écrits par des locuteurs d'anglais non natifs comme générés par l'IA. La même étude a mis en évidence que chaque panel de conduite devrait lire: les faux positifs ne tombent pas uniformément; ils atterrissent le plus dur sur les écrivains dont l'anglais ne correspond pas aux données de formation
C'est pourquoi les résultats de 61 pour cent ont voyagé jusqu'à présent.Ce n'était pas une affirmation que chaque accusation est fausse.C'était une démonstration que le taux d'erreur est concentré parmi les étudiants les moins susceptibles d'avoir le pouvoir institutionnel de repousser.
Une analyse théorique distincte des informaticiens de l'Université du Maryland a soutenu que la détection fiable du texte généré par l'IA n'est pas seulement difficile, mais fondamentalement instable à mesure que les modèles s'améliorent.Étude de détecteur-bias menée par Stanfordet leAnalyse de Maryland des limites du détecteurIls sont devenus les deux éléments de preuve les plus souvent cités dans les débats sur le campus sur la question de savoir si les outils doivent être allumés.
Cependant, le score arrive souvent dans la boîte de réception d'un instructeur avec le même poids visuel qu'un rapport de similitude, et que l'écart entre l'orientation et l'habitude est où commence la plupart des erreurs de mauvaise conduite.
Ce que les universités ont vraiment changé sur le papier
Tout au long du patchwork, quatre positions continuent d'apparaître: restriction difficile, utilisation conditionnelle avec divulgation, délégation de cours par cours et redéfinition d'évaluation.
| Institution ou groupe | date | Positionnement |
|---|---|---|
| Sciences Po | janvier 2023 | Restriction de ChatGPT dans les évaluations, sauf si un conférencier l'a expressément autorisé. |
| Turné | Avril 2023 | Lancé un indicateur d'écriture d'IA pour les institutions en utilisant son outil de similitude. |
| Universités du Groupe Russell | Juillet 2023 | Il a publié cinq principes qui soutiennent l'alphabétisation de l'IA et la prise de décision au niveau des cours. |
| Université de Vanderbilt | août 2023 | Détecteur d'IA de Turnitin pour les nouvelles soumissions, citant des préoccupations de fiabilité. |
| L’UNESCO | Septembre 2023 | Des directives publiées exhortant à une utilisation centrée sur l’homme et inclusive avec une responsabilité claire. |
Lorsque Turnitin a allumé le détecteur, la société a déclaré qu'environ 3 pour cent des papiers étudiants dans son premier échantillon affichaient 80 pour cent ou plus de texte écrit par l'IA. Un petit pourcentage sur un grand dénominateur signifie toujours des milliers d'étudiants flagellés, et que l'arithmétique a poussé de nombreux campus vers des procédures de conversation-premier.
Après ces premiers mouvements, les questions plus difficiles se sont déplacées vers la conception d'évaluation.Les institutions qui ont maintenu le détecteur l'ont souvent associé à un processus: un score marqué a déclenché une conversation, pas une charge automatique.L'Université de Glasgow, par exemple, a publié une orientation exigeant des étudiants de déclarer comment ils utilisaient l'IA générative et de dire au personnel quand une utilisation non autorisée constituerait une mauvaise conduite.Document d’orientation de l’UNESCOIl reste une référence utile car il relie la politique à l’inclusion, à la protection des données et à la nécessité d’un examen humain plutôt que d’un jugement algorithmique.
Photo by Markus Winkler on Unsplash
Hype versus réalité : un tableau de bord
Quatre revendications ont conduit la conversation. Aucun n'a survécu au contact avec la pratique du campus inchangée.
- Réclamation :Les détecteurs d’IA peuvent identifier le travail généré par l’IA avec une grande précision.La réalité :Ils produisent un score de confiance qui change avec les mises à jour des modèles et classifie mal l'écriture en anglais non natif à des taux élevés, ce qui explique pourquoi plusieurs institutions refusent d'utiliser le score comme preuve.
- Réclamation :Les universités ont désormais des politiques d’IA claires et uniformes.La réalité :Les politiques sont claires au niveau d'un cours ou d'un département individuel, et contradictoires à travers elles; la norme est un ensemble de décisions locales.
- Réclamation :L’interdiction de l’IA générative protégera l’intégrité de l’évaluation.La réalité :Les interdictions de blanchisserie sont presque inapplicables car les mêmes outils sont intégrés dans les processeurs de mots et les moteurs de recherche, et la détection ne peut pas soutenir de manière fiable l'application.
- Réclamation :Permettre l’utilisation de l’IA provoquera une vague d’écriture de fantômes sans défi.La réalité :Le problème le plus commun est l'assistance non déclarée à l'échelle, qui est un problème de divulgation, pas un problème de détection.
Les universités qui traitent le problème comme un problème de divulgation dépensent leur énergie sur de nouveaux formats d'évaluation et des instructions claires.
Quel sera le prochain cycle politique
Si le premier cycle de politique concernait la détection, le second concernait la preuve. Les panneaux de conduite ont besoin d'un standard de preuve qui ne s'appuie pas sur un algorithme propriétaire que personne ne peut inspecter. La faculté a besoin de conceptions d'évaluation qui récompensent le travail qu'une AI ne peut pas faire seule, et ils ont besoin de temps pour les redessiner.
Le problème n'a jamais été le détecteur. C'est les quinze minutes par essai marqué que personne ne budgetne. Un score arrive, un étudiant répond avec leur histoire d'édition, et un instructeur qui enseigne déjà quatre cours est invité à peser un nombre propriétaire contre une explication humaine. documents de politique qui ignorent ces quinze minutes sont du théâtre.
Pour les académiciens qui regardent les universités qui embauchent, le test pratique est simple. Demander ce qui se passe quand un détecteur marque l'essai d'un étudiant. Une bonne réponse décrit une conversation et un deuxième lecteur. Une mauvaise réponse décrit un score de seuil. Les auteurs de l'étude de détecteur-bias menée par Stanford mettent clairement l'avertissement: les faux positifs risquent de pénaliser les mêmes écrivains que les outils sont destinés à protéger.
