Análisis reciente revela fugas de datos no intencionales generalizadas en fuentes de impresión
Los investigadores que confían en el servidor de preimpresión arXiv para la rápida difusión de su trabajo se enfrentan a un nuevo conjunto de desafíos.Un estudio completo publicado en abril de 2026 revela que los archivos fuente que acompañan a millones de envíos a menudo contienen detalles sensibles nunca destinados a la vista pública.Estos incluyen contraseñas, claves de API, comunicaciones privadas de autores, coordenadas GPS y notas internas que podrían comprometer la privacidad o la reputación profesional.
Los hallazgos llegan en un momento en que las prédicas juegan un papel cada vez más central en la publicación académica, en particular en física, informática y matemáticas.Los autores suben archivos de fuente de LaTeX para permitir la reproductibilidad y la ciencia abierta, pero esta práctica revela inadvertidamente mucho más de lo que revela la versión final de PDF.
Conocimiento de arXiv y las prácticas de archivos de fuente
arXiv, fundada en 1991, sirve como una plataforma primaria para compartir préstamos antes de una revisión formal por pares. En los campos que dependen en gran medida de LaTeX para la preparación de documentos, el repositorio requiere que los autores proporcionen archivos fuente junto con el PDF renderizado.
Sin embargo, los archivos LaTeX funcionan de manera similar al código de programación. A menudo incluyen comentarios que no aparecen en el documento final, pero permanecen visibles en la fuente. Archivos adicionales como imágenes con metadatos incorporados, scripts auxiliares, o incluso carpetas enteras de proyectos pueden acompañar las presentaciones. Con el tiempo, estos elementos se acumulan en varias versiones de una preimpresión, creando un registro persistente que se extiende mucho más allá de lo que los autores suelen revisar antes de cargar.
El estudio Landmark y su alcance
La investigación primaria, titulada Secretos ocultos en el arXiv, examinó aproximadamente 2,7 millones de presentaciones que representan el 93 por ciento de los préstamos disponibles hasta diciembre de 2025.Liderado por Jan Pennekamp de la Universidad de RWTH Aachen, el equipo analizó tres categorías principales de divulgación potencial: archivos innecesarios o pendulares, metadatos incorporados en imágenes y documentos, y contenido irrelevante como los comentarios de LaTeX.
Los resultados indicaron que casi cada envío contenía alguna forma de información oculta. Entre aquellos con fuentes de LaTeX, el 88 por ciento incluyó material que los autores probablemente no tenían intención de compartir públicamente.El estudio identificó historias completas de Git, enlaces a documentos web editables y numerosas instancias de cadenas de credenciales.
Un análisis acompañante de 100.000 presentaciones llegó a conclusiones similares a través de diferentes métodos, destacando miles de fugas de información de identificación personal y cientos de exposiciones credenciales.
Tipos de contenidos no deseados descubiertos
Las conversaciones privadas entre coautores aparecieron frecuentemente, incluyendo desacuerdos, comentarios profanos sobre competidores, y listas de tareas que señalan debilidades en la investigación que nunca fueron abordadas en el texto publicado.
Los investigadores encontraron 265 claves API, 4 claves privadas y 171 contraseñas en todo el conjunto de datos. imágenes etiquetadas con GPS aparecieron en 7.326 presentaciones, con 235 casos que muestran coordenadas consistentes con los lugares de trabajo y residencial.
Las exposiciones adicionales incluyeron 699 enlaces de Google Docs que otorgaban acceso de edición abierta, algunos llevando a revisiones de pares, minutos de reunión o incluso datos de encuestas de participantes de estudios de sujetos humanos.
Photo by Zulfugar Karimov on Unsplash
Impacto en los investigadores e instituciones
Las consecuencias se extienden más allá de los inconvenientes técnicos.Un comentario embarazoso o una nota privada que surja públicamente puede dañar la reputación, especialmente cuando se amplifica a través de las redes sociales.Los datos de ubicación sensibles plantean consideraciones de seguridad personal, mientras que las credenciales expuestas crean oportunidades para el acceso no autorizado a cuentas de investigación o servicios en la nube.
Las instituciones pueden enfrentar responsabilidad si los materiales filtrados involucran datos de estudiantes, información relacionada con subvenciones o proyectos colaborativos con socios de la industria.La persistencia de todas las versiones preimpresas en arXiv significa que incluso las presentaciones corregidas o retiradas dejan rastros que permanecen accesibles indefinidamente.
Las respuestas de la encuesta de los autores afectados resaltaron una brecha clave en la concienciación.Sólo el 41 por ciento de los contactados se dio cuenta de que arXiv publica archivos fuentes junto a PDFs. Muchos asumieron que el repositorio se comportaba como una revista tradicional, donde sólo el documento formateado final se hace público.
Comparación con resultados relacionados en otras plataformas
Los análisis de los repositorios de código de GitHub han documentado la fuga de credenciales, aunque los desarrolladores allí generalmente entienden la naturaleza pública de su trabajo. el contexto arXiv difiere porque los investigadores a menudo tratan los archivos fuente como documentos de trabajo internos en lugar de artefactos publicables.
Estudios anteriores sobre el propio arXiv, incluyendo uno que examinó 600.000 préstamos para datos residuales y otro que utilizó modelos de lenguaje en 100.000 presentaciones, identificaron patrones comparables de detalles no revelados y declaraciones sensibles.
Las herramientas actuales y sus limitaciones
Sin embargo, el estudio primario demostró que estas herramientas a menudo fallan en capturar todos los elementos problemáticos, particularmente en las presentaciones complejas de varios archivos o cuando los archivos de datos auxiliares permanecen adjuntos.
arXiv proporciona orientación de alto nivel en su sitio recomendando que los autores limpien sus fuentes, poniendo la responsabilidad exclusivamente en los individuos.
Recomendaciones y soluciones emergentes
Los expertos advierten por una mejor educación de los autores durante el proceso de carga. advertencias más claras, listas de verificación interactivas y herramientas de limpieza integradas podrían reducir significativamente las revelaciones accidentales. Los operadores de repositorios podrían considerar funciones opcionales de saneamiento de archivos fuente que preserven elementos esenciales de reproductibilidad al tiempo que eliminan comentarios y adjuntos innecesarios.
Los investigadores pueden adoptar hábitos proactivos como la compilación de archivos de fuente limpia antes de la presentación, la revisión de todos los archivos acompañantes individualmente, y evitar la carga de historias de control de versiones o directorios de diseños.
El desarrollo de limpiadores automatizados más robustos, incluyendo uno propuesto en el estudio principal llamado ALC-NG, ofrece la promesa de la eliminación completa de contenidos no esenciales mientras se mantiene la capacidad de reproducir el papel.
Photo by Zulfugar Karimov on Unsplash
Implicaciones más amplias para la ciencia abierta
La situación pone de relieve una tensión en el corazón de las iniciativas de ciencia abierta.La mayor transparencia acelera el descubrimiento y la verificación, pero también amplifica los riesgos asociados con la higiene de datos incompleta.
A medida que la adopción de preprint continúa creciendo en todas las disciplinas, las lecciones de arXiv probablemente influirán en las políticas en otros servidores. medidas proactivas de hoy pueden ayudar a preservar la confianza en las prácticas de difusión abierta durante los próximos años.
Perspectivas futuras y respuesta de la comunidad
Las discusiones de la comunidad después de la presentación del estudio en el Simposio IEEE sobre Seguridad y Privacidad sugieren un reconocimiento creciente de que las soluciones técnicas y los cambios culturales deben proceder juntos.
Las futuras actualizaciones a las plataformas de preimpresión pueden incluir controles de metadatos mejorados o escaneo automatizado para patrones de fugas comunes.
Los investigadores interesados en recursos de carrera relacionados en la navegación por la publicación académica y las mejores prácticas digitales pueden explorar oportunidades a través de plataformas de empleo especializadas enfocadas en roles de educación superior y investigación.
