Un postdoc que j'appellerai Dr. S a passé deux nuits à reconstruire une figure de western blot parce que l'assistant d'un réviseur a marqué une bande dupliquée. Le fichier brut a montré que l'image était propre; le modèle de diapositive a répété une étiquette de bande, pas un résultat. Multiplier Dr. S par les milliers de documents qui contiennent quelque chose de pire. Une analyse 2016 mBio de 20,621 articles biomédicaux a trouvé des images problématiques dans 3,8 pour cent d'entre eux, avec au moins la moitié montrant des signes de manipulation délibérée. Cette étude a fixé le taux de base, et c'est la raison pour laquelle les éditeurs exécutent maintenant un nouveau logiciel de détection d'IA
Les outils ne fonctionnent pas comme un œil humain. Ce sont des systèmes de vision informatique formés pour détecter des régions dupliquées, des rotations, des flips, des flips et des modifications de copie-mouvement au sein d'une seule figure. Proofig et ImageTwin sont deux systèmes commerciaux maintenant utilisés par les revues et les éditeurs; l'Association internationale des éditeurs scientifiques, techniques et médicaux (STM) a commencé à intégrer des vérifications d'images similaires à travers son hub d'intégrité transversale. Cela prend des secondes par figure, pas des minutes ou des heures. Cette vitesse est ce qui a changé.
Pourquoi les éditeurs examinent maintenant chaque figure
Cette étude, menée par Elisabeth Bik et ses collègues, a examiné des articles de 40 revues et a trouvé des bandes dupliquées, des champs de microscopie réutilisés et des sections tournées ou redimensionnées dans environ un article sur 26.mBioLes auteurs ont estimé que plus de la moitié des images marquées suggèrent une manipulation intentionnelle, tandis que le reste ressemblait à des erreurs d'assemblage.
Le résultat est que les éditeurs et les éditeurs se sont déplacés du prélèvement d'échantillons au dépistage universel. Un journal qui a traité près de quelques centaines d'images à l'œil peut maintenant exécuter un problème complet via le logiciel en une après-midi. Cela augmente la probabilité qu'une figure floue ou frauduleuse soit prise avant la publication. Il produit également de faux positifs, ce qui explique pourquoi les revues maintiennent l'examen humain dans la boucle. Le taux acceptable de faux-positifs dépend du champ, du type de figure et des enjeux d'un retrait. Dans les revues de biologie cellulaire à haut volume, la tolérance pour manquer une bande dupliquée est proche de
À l'intérieur des nouveaux outils de dépistage d'IA
Les méthodes de base tirent de l'analyse de l'image judiciaire et de la vision informatique. Un détecteur divise chaque figure en carreaux, compare les carreaux pour la similitude lors des transformations et cartographie des régions qui correspondent plus que prévu. Certains outils regardent également les panneaux de blot, les panneaux de microscopie et les diagrammes de cytométrie de flux séparément parce que chaque format échoue de différentes manières. L'outil commercial Proofig annonce des vérifications pour les sections d'image dupliquées, retournées et tournées. ImageTwin offre une approche similaire et a été testé par les éditeurs pour le dépistage préalable.Hub d’intégrité STMfournit une infrastructure partagée afin que les éditeurs puissent scanner les manuscrits avec des outils communs avant la révision éditoriale.Cette couche partagée importe parce que les moulins à papier soumettent la même figure fabricée à plusieurs revues.
Une limitation: ces systèmes sont meilleurs pour trouver des régions dupliquées à l'intérieur d'un seul papier que pour localiser une figure copiée de la publication d'une autre personne. Ils ont besoin d'une base de données de référence pour capturer la duplication sur papier, et ces bases de données sont inégales dans toutes les disciplines. Un blot occidental d'un papier de 2008 peut ne pas être indexé de manière à ce que le logiciel puisse rechercher rapidement. Le taux de base de duplication détectable est donc inférieur au taux réel. Ce fossé est un problème d'infrastructure de données, pas un manque d'ambition algorithmique.
L'évaluation humaine continue de décider
Après que le logiciel marque un chiffre, un éditeur ou un responsable de l'intégrité de la recherche vérifie les fichiers originaux et demande aux auteurs des données brutes.Lignes directrices d’image numériqueFaites un point à plusieurs reprises : toute modification qui modifie l'interprétation est inacceptable, tandis que les ajustements de luminosité ou de contraste mineurs appliqués à l'ensemble de l'image sont généralement bons. Une bande dupliquée dans une figure peut être une erreur honnête de coupure et de collage si le fichier brut correspondant est intact et que les données sous-jacentes sont authentiques. Si le fichier brut est absent, les options de l'éditeur sont étroites et le rejet devient plus probable.
J'ai regardé un laboratoire voisin gérer cela mal. Un ancien assistant de recherche avait collé une bande d'une expérience à une autre figure, puis a quitté l'institution. L'investigateur principal a passé quatre semaines à reconstruire ce que l'assistant avait fait, et le journal a retiré deux articles. Le PI a fait la bonne chose après le fait. Ce que les nouveaux outils d'IA font est de rapprocher cette confrontation de la soumission, avant qu'un papier ait le temps d'influencer un domaine.
Ceci fait partie d'un changement plus large dans les pipelines de soumission.La même infrastructure qui exécute désormais les vérifications d'image est alignée sur les moulins à papier, un problème couvert dans les rapports antérieurs sur laRetrait de masse de Wiley et HindawiLes éditeurs combinent la forense de l'image avec la vérification de l'auteur et les vérifications de soumission dupliquées. Aucune de ces étapes seule n'arrête la fabrication; ensemble, ils augmentent le coût d'obtenir une fausse figure.
Ce que cela signifie pour votre laboratoire
Traitez l'intégrité de l'image comme une habitude de pré-submission, pas une réflexion postérieure.Les étapes pratiques sont petites, et elles s'alignent avec les pratiques de partage de données que la plupart des laboratoires prétendent déjà suivre.
- Conservez les fichiers d'images bruts et non modifiés dans un dossier distinct des figures traitées et n'écrivez jamais le fichier brut.
- Étiqueter chaque étape de traitement dans un fichier texte à côté des données, y compris les ajustements de luminosité et de cropping.
- Exécutez vos propres chiffres à travers un outil de vérification d'image avant de les soumettre lorsque le journal ou votre institution en propose un.
- Pour chaque chiffre, préparez les paramètres de données brutes et d'acquisition afin que vous puissiez répondre à une requête d'image dans les 48 heures au lieu de trois semaines.
- Si une figure contient des contrôles réutilisés, annotez cela clairement dans la légende de la figure et dans la lettre de couverture.
L'étape la moins confortable est la dernière: si vous trouvez un problème dans la figure d'un collègue, dites-le avant que le manuscrit ne quitte le laboratoire.Le coût d'une conversation gênante à la soumission est une fraction du coût d'un retrait après la publication.La peur de l'image propre du Dr S a été triée en deux jours parce que les fichiers bruts ont été nommés correctement et que le cahier du laboratoire était lisible.Le PI à côté a passé quatre semaines sur la même question parce que ces fichiers n'existaient pas.
Commencez par le prochain manuscrit que votre laboratoire soumettra, pas celui qui est déjà en cours de révision.Téléchargez le guide d'image du journal, vérifiez l'outil de préparation de figure et créez un dossier appelé raw_images avec une README.Si le journal ne peut pas vous dire comment les requêtes d'image sont jugées, demandez.
