Academic Jobs - Home of Higher Ed Logo

Détection de la manipulation d'images : de nouveaux outils d'IA signalent les données de recherche falsifiées

Poster une histoire
48vues
turned-on lamps
Photo by Emanuel Saleniuc on Unsplash

Un postdoc que j'appellerai Dr. S a passé deux nuits à reconstruire une figure de western blot parce que l'assistant d'un réviseur a marqué une bande dupliquée. Le fichier brut a montré que l'image était propre; le modèle de diapositive a répété une étiquette de bande, pas un résultat. Multiplier Dr. S par les milliers de documents qui contiennent quelque chose de pire. Une analyse 2016 mBio de 20,621 articles biomédicaux a trouvé des images problématiques dans 3,8 pour cent d'entre eux, avec au moins la moitié montrant des signes de manipulation délibérée. Cette étude a fixé le taux de base, et c'est la raison pour laquelle les éditeurs exécutent maintenant un nouveau logiciel de détection d'IA

Les outils ne fonctionnent pas comme un œil humain. Ce sont des systèmes de vision informatique formés pour détecter des régions dupliquées, des rotations, des flips, des flips et des modifications de copie-mouvement au sein d'une seule figure. Proofig et ImageTwin sont deux systèmes commerciaux maintenant utilisés par les revues et les éditeurs; l'Association internationale des éditeurs scientifiques, techniques et médicaux (STM) a commencé à intégrer des vérifications d'images similaires à travers son hub d'intégrité transversale. Cela prend des secondes par figure, pas des minutes ou des heures. Cette vitesse est ce qui a changé.

Pourquoi les éditeurs examinent maintenant chaque figure

Cette étude, menée par Elisabeth Bik et ses collègues, a examiné des articles de 40 revues et a trouvé des bandes dupliquées, des champs de microscopie réutilisés et des sections tournées ou redimensionnées dans environ un article sur 26.mBioLes auteurs ont estimé que plus de la moitié des images marquées suggèrent une manipulation intentionnelle, tandis que le reste ressemblait à des erreurs d'assemblage.

Le résultat est que les éditeurs et les éditeurs se sont déplacés du prélèvement d'échantillons au dépistage universel. Un journal qui a traité près de quelques centaines d'images à l'œil peut maintenant exécuter un problème complet via le logiciel en une après-midi. Cela augmente la probabilité qu'une figure floue ou frauduleuse soit prise avant la publication. Il produit également de faux positifs, ce qui explique pourquoi les revues maintiennent l'examen humain dans la boucle. Le taux acceptable de faux-positifs dépend du champ, du type de figure et des enjeux d'un retrait. Dans les revues de biologie cellulaire à haut volume, la tolérance pour manquer une bande dupliquée est proche de

À l'intérieur des nouveaux outils de dépistage d'IA

Les méthodes de base tirent de l'analyse de l'image judiciaire et de la vision informatique. Un détecteur divise chaque figure en carreaux, compare les carreaux pour la similitude lors des transformations et cartographie des régions qui correspondent plus que prévu. Certains outils regardent également les panneaux de blot, les panneaux de microscopie et les diagrammes de cytométrie de flux séparément parce que chaque format échoue de différentes manières. L'outil commercial Proofig annonce des vérifications pour les sections d'image dupliquées, retournées et tournées. ImageTwin offre une approche similaire et a été testé par les éditeurs pour le dépistage préalable.Hub d’intégrité STMfournit une infrastructure partagée afin que les éditeurs puissent scanner les manuscrits avec des outils communs avant la révision éditoriale.Cette couche partagée importe parce que les moulins à papier soumettent la même figure fabricée à plusieurs revues.

Une limitation: ces systèmes sont meilleurs pour trouver des régions dupliquées à l'intérieur d'un seul papier que pour localiser une figure copiée de la publication d'une autre personne. Ils ont besoin d'une base de données de référence pour capturer la duplication sur papier, et ces bases de données sont inégales dans toutes les disciplines. Un blot occidental d'un papier de 2008 peut ne pas être indexé de manière à ce que le logiciel puisse rechercher rapidement. Le taux de base de duplication détectable est donc inférieur au taux réel. Ce fossé est un problème d'infrastructure de données, pas un manque d'ambition algorithmique.

L'évaluation humaine continue de décider

Après que le logiciel marque un chiffre, un éditeur ou un responsable de l'intégrité de la recherche vérifie les fichiers originaux et demande aux auteurs des données brutes.Lignes directrices d’image numériqueFaites un point à plusieurs reprises : toute modification qui modifie l'interprétation est inacceptable, tandis que les ajustements de luminosité ou de contraste mineurs appliqués à l'ensemble de l'image sont généralement bons. Une bande dupliquée dans une figure peut être une erreur honnête de coupure et de collage si le fichier brut correspondant est intact et que les données sous-jacentes sont authentiques. Si le fichier brut est absent, les options de l'éditeur sont étroites et le rejet devient plus probable.

J'ai regardé un laboratoire voisin gérer cela mal. Un ancien assistant de recherche avait collé une bande d'une expérience à une autre figure, puis a quitté l'institution. L'investigateur principal a passé quatre semaines à reconstruire ce que l'assistant avait fait, et le journal a retiré deux articles. Le PI a fait la bonne chose après le fait. Ce que les nouveaux outils d'IA font est de rapprocher cette confrontation de la soumission, avant qu'un papier ait le temps d'influencer un domaine.

Ceci fait partie d'un changement plus large dans les pipelines de soumission.La même infrastructure qui exécute désormais les vérifications d'image est alignée sur les moulins à papier, un problème couvert dans les rapports antérieurs sur laRetrait de masse de Wiley et HindawiLes éditeurs combinent la forense de l'image avec la vérification de l'auteur et les vérifications de soumission dupliquées. Aucune de ces étapes seule n'arrête la fabrication; ensemble, ils augmentent le coût d'obtenir une fausse figure.

Ce que cela signifie pour votre laboratoire

Traitez l'intégrité de l'image comme une habitude de pré-submission, pas une réflexion postérieure.Les étapes pratiques sont petites, et elles s'alignent avec les pratiques de partage de données que la plupart des laboratoires prétendent déjà suivre.

  • Conservez les fichiers d'images bruts et non modifiés dans un dossier distinct des figures traitées et n'écrivez jamais le fichier brut.
  • Étiqueter chaque étape de traitement dans un fichier texte à côté des données, y compris les ajustements de luminosité et de cropping.
  • Exécutez vos propres chiffres à travers un outil de vérification d'image avant de les soumettre lorsque le journal ou votre institution en propose un.
  • Pour chaque chiffre, préparez les paramètres de données brutes et d'acquisition afin que vous puissiez répondre à une requête d'image dans les 48 heures au lieu de trois semaines.
  • Si une figure contient des contrôles réutilisés, annotez cela clairement dans la légende de la figure et dans la lettre de couverture.

L'étape la moins confortable est la dernière: si vous trouvez un problème dans la figure d'un collègue, dites-le avant que le manuscrit ne quitte le laboratoire.Le coût d'une conversation gênante à la soumission est une fraction du coût d'un retrait après la publication.La peur de l'image propre du Dr S a été triée en deux jours parce que les fichiers bruts ont été nommés correctement et que le cahier du laboratoire était lisible.Le PI à côté a passé quatre semaines sur la même question parce que ces fichiers n'existaient pas.

Commencez par le prochain manuscrit que votre laboratoire soumettra, pas celui qui est déjà en cours de révision.Téléchargez le guide d'image du journal, vérifiez l'outil de préparation de figure et créez un dossier appelé raw_images avec une README.Si le journal ne peut pas vous dire comment les requêtes d'image sont jugées, demandez.

U.S. America flag on green board

Photo by Jon Tyson on Unsplash

Portrait de Dr. Nathan Harlow
A propos de l'auteur

Dr. Nathan HarlowVoir auteur

Academic Jobs In House Author

Discussions

Sort par :

Soyez le premier à commenter cet article !

vous

Vous serez invité à vous connecter avant de publier votre commentaire.

Nouvelle0 comments

Rejoignez la conversation !

Ajoutez vos commentaires dès maintenant !

Avoir votre mot

Niveau d’engagement

Browse par faculté

Browse par sujet

Frequently Asked Questions

🔬Qu'est-ce que la détection de manipulation d'images par IA dans la recherche ?

La détection de manipulation d'images par IA utilise la vision par ordinateur pour analyser les figures dans les soumissions de revues pour détecter des régions dupliquées, retournées, tournées ou truquées. Les outils comparent des tuiles d'images sous transformations et signalent les modèles qui suggèrent qu'une bande, un champ de cellules ou un panneau a été réutilisé de manière inappropriée. Les éditeurs utilisent cela avant la révision par les pairs. Le logiciel signale ; les réviseurs et les éditeurs humains décident.

📊Quelle est la fréquence de la duplication d'images dans les articles biomédicaux ?

La référence largement citée est de 3,8 pour cent, issue d'une analyse mBio de 2016 de 20 621 articles biomédicaux dans 40 revues. Plus de la moitié des images signalées semblaient montrer une manipulation intentionnelle. Le reste ressemblait à des erreurs d'assemblage.

🤖Quels outils les revues utilisent-ils pour détecter les images de recherche truquées ?

Les outils commerciaux incluent Proofig et ImageTwin, tous deux conçus pour un contrôle au niveau de la figure. L'infrastructure partagée telle que le STM Integrity Hub permet aux éditeurs d'effectuer des vérifications communes sur de nombreuses revues avant l'examen éditorial. Les auteurs rencontrent ces outils lors de la soumission, souvent sans savoir lequel a signalé une figure.

⚠️Ces outils peuvent-ils détecter tous les types de manipulations d'images ?

Ils sont plus efficaces pour détecter les duplications au sein d'un article que les plagats entre articles, et ils produisent des faux positifs. Une bande dupliquée signalée peut s'avérer être un contrôle de chargement répété, une erreur d'assemblage honnête ou un véritable éclat. Les logiciels ne peuvent pas prouver l'intention ; les fichiers bruts originaux restent la preuve décisive.

📄Que doivent faire les auteurs avant de soumettre des figures ?

Conservez les fichiers d'images brutes non modifiés dans un dossier séparé, documentez chaque étape de traitement et annotez les contrôles réutilisés dans la légende de la figure. Exécutez un vérificateur d'images de préimpression ou fourni par le journal lorsque disponible. Préparez les paramètres d'acquisition et les fichiers bruts afin qu'une requête puisse être répondue dans les 48 heures.

⚖️Les images signalées sont-elles toujours retirées ?

Non. Si les auteurs fournissent les données brutes et expliquent une erreur d'assemblage honnête, l'article peut continuer ou recevoir une correction. Le retrait est plus probable lorsque les fichiers bruts sont absents, lorsque la manipulation change l'interprétation scientifique, ou lorsque les auteurs ne peuvent pas reproduire les données originales.

🧬Que disent les lignes directrices du COPE sur l'ajustement d'images ?

Les lignes directrices d'images numériques du COPE disent que les ajustements de luminosité ou de contraste d'une image entière sont généralement acceptables s'ils ne cachent ou n'altèrent aucune caractéristique. Les éditions sélectives, le clonage et la réutilisation de parties d'une image dans une autre ne sont pas autorisés.

🧑‍🔬L'IA remplace-t-elle l'évaluation par les pairs humains ?

Non. L'IA analyse les figures et met en évidence les anomalies. Les évaluateurs, les rédacteurs et les responsables de l'intégrité de la recherche évaluent les données originales, le contexte de la figure et la réponse des auteurs. Les outils réduisent la charge de vérification manuelle ; ils n'éliminent pas le jugement humain.

🔍Pourquoi les éditeurs créent-ils des plateformes de dépistage partagées ?

Des plateformes partagées comme le STM Integrity Hub aident les éditeurs à détecter les mêmes figures fabriquées soumises à plusieurs revues par des usines à papier. Une figure signalée dans un manuscrit peut alerter les vérifications ailleurs. Cette mutualisation entre éditeurs est une réponse aux rétractations à grande échelle, notamment l'affaire de l'usine à papier Wiley-Hindawi.

🌱Qu'est-ce que cela signifie pour les jeunes chercheurs ?

Les chercheurs en début de carrière devraient considérer la documentation d'images brutes comme une habitude professionnelle dès le premier jour. Un dossier de données brutes propre vous protège si un co-auteur ou un prédécesseur commet une erreur. Les revues scientifiques s'attendent de plus en plus à ce que les données brutes soient disponibles en cas de questions sur les images.

✅Quelle est la première étape pour vérifier mes propres images ?

Configurez un dossier raw_images avec un fichier README. Laissez les fichiers non modifiés intacts et répertoriez chaque ajustement dans un fichier texte à côté des données. Si votre institution ou votre revue fournit un outil de vérification d'images, faites passer vos figures à travers celui-ci avant la soumission formelle.

🗂️Combien de temps faut-il conserver les fichiers d'images brutes ?

Les politiques institutionnelles exigent généralement que les données de recherche soient conservées pendant plusieurs années après publication, souvent entre trois et dix ans selon le financeur et le domaine. Dans la pratique, conservez les fichiers d'images brutes plus longtemps que le postdoctorant qui les a générés est susceptible de rester. Cela protège le laboratoire lorsque des questions surgissent des années plus tard.