El 31 de enero de 2025, los Centros para el Control y la Prevención de Enfermedades comenzaron a descargar páginas y herramientas de datos que contenían términos marcados en un memorando de 29 de enero de la Oficina de Gestión de Personal de los Estados Unidos. En unos días, las descargas habían llegado a la Administración de Alimentos y Medicamentos, los Institutos Nacionales de Salud y otras partes del Departamento de Salud y Servicios Humanos.
Nadie te dice que los datos federales de salud pueden desaparecer más rápido que un plazo de concesión se escapa a ti. Aprendí esto de la manera difícil. Hace años, asumí que un archivo de encuesta gubernamental permanecería en la misma URL para siempre. Mi estrategia de copia de seguridad era la esperanza.
La frase no es sinónimo de un sitio web roto.Describe una situación donde un conjunto de datos existe, o existió, pero la versión que un investigador necesita ya no es accesible de manera fiable, citable, o comparable con la versión utilizada en el análisis anterior.
Las remodelaciones comenzaron con un memorando y terminaron en un tribunal federal
El memorando del 29 de enero de 2025 de la Oficina de Gestión de Personal instruyó a las agencias a eliminar los materiales relacionados con lo que llamó ideología de género de los sistemas dirigidos al público. El personal del CDC fue instruido a sacar páginas que contenían palabras como género, transexual, equidad, inclusión y otras. Un juez federal intervino el 11 de febrero de 2025, ordenando al CDC y a la FDA que restablecieran las páginas eliminadas bajo la directiva.
Lo que hizo esto diferente de un rediseño de sitio web ordinario fue la escala y la ausencia de aviso. Se supone que los productos estadísticos federales se preparan y publican bajo políticas que los protejan de la interferencia política. Los investigadores planean estudios, escriben solicitudes de subvenciones y calibran modelos alrededor de la expectativa de que los archivos del sistema de vigilancia del comportamiento de los jóvenes de 2021 todavía estarán disponibles cuando comiencen los análisis de 2025.
Una crisis de disponibilidad de datos significa control de versiones, no sólo enlaces rotos
Piense en un conjunto de datos gubernamentales como una tarjeta de receta familiar.Si alguien retipa la tarjeta y cambia un ingrediente pero mantiene el mismo título, la casserola tiene un sabor diferente y nadie puede decir exactamente por qué.Lo mismo sucede cuando un archivo de encuesta de salud pública se elimina, edita y reposta sin un historial de versiones claro.Los investigadores pueden terminar comparando estimaciones que no se construyeron sobre el mismo denominador o la misma formulación.
El problema no es que las agencias federales nunca actualicen los conjuntos de datos. Ellos lo hacen, y una buena versión es parte de su trabajo. El problema es que las remociones fueron rápidas, la documentación era delgada, y las URL originales a menudo dejaron de resolver. Para un equipo de investigación universitaria, eso no es un inconveniente. Es una amenaza para la replicación, para la revisión por pares, y para la integridad de la investigación de salud pública longitudinal.
Los conjuntos de datos bajo la tensión más aguda
Entre las herramientas que los investigadores firmaron en las primeras semanas de febrero estaban el Sistema de Vigilancia del Comportamiento de Riesgos Juveniles del CDC, conocido como YRBSS, que rastrea los comportamientos de riesgo de salud entre los adolescentes; el Índice de Vulnerabilidad Social, ampliamente utilizado en la preparación para desastres y la investigación de equidad de la salud; y el portal AtlasPlus para el VIH, la hepatitis viral, la tuberculosis y los datos de vigilancia de enfermedades de transmisión sexual.
- Los archivos YRBSS y las herramientas de consulta que los investigadores de salud de la escuela utilizan para rastrear las tendencias en la depresión, el vaping y el comportamiento de salud sexual.
- El Índice de Vulnerabilidad Social, que combina las variables del censo en una única medida utilizada por los planificadores de emergencias y los investigadores universitarios que estudian los resultados de los desastres.
- El portal AtlasPlus, donde los departamentos estatales y locales de salud construyen curvas epidémicas y comparan las tasas entre los condados.
- Diferencias de salud y determinantes sociales páginas que proporcionaron documentación para las variables utilizadas en los estudios financiados.
Una página que regresa con un nuevo idioma no es lo mismo que un conjunto de datos que regresa con su diccionario de variables original. Incluso cuando un archivo regresó, los investigadores tuvieron que comprobar si los nombres de las variables, la codificación y el texto del cuestionario coincidían con la versión que habían citado en un manuscrito o una subvención.
Los bibliotecarios de datos universitarios se convirtieron en el sistema de backup por defecto
En pocos días, los bibliotecarios de datos y las organizaciones de investigación de datos comenzaron a tratar las remociones como una emergencia de archivo.El Proyecto de Rescate de Datos, un esfuerzo comunitario coordinado por profesionales de datos, publica directrices y recoge copias de conjuntos de datos federales en riesgo.Proyecto de rescate de datosfue uno de los caminos más rápidos en ese trabajo.Los investigadores también seLos datos, un archivo abierto construido para los datos del sector público, y a Harvard Dataverse para los depósitos de versiones.Fin del término archivo webhabía sido rastreando sitios federales en cambios de administración desde 2008, y sus instantáneas se convirtieron repentinamente en la infraestructura de trabajo para los artículos científicos.
Las bibliotecas universitarias ahora se enfrentan a una reversión de roles. En lugar de apuntar a los investigadores a los portales gubernamentales, están almacenando las copias que los investigadores necesitan. Ese cambio es bueno, pero pone a las bibliotecas en una posición que no pueden mantener por sí solas. Las copias de archivo son tan útiles como los metadatos a su alrededor: quién capturó el archivo, cuándo, desde qué URL y con qué checksum.
Para el cumplimiento de la publicación y la concesión, los datos de origen que faltan son ahora un riesgo de flujo de trabajo
El lado financiero de esta crisis no está separado del lado de los datos. Cuando los Institutos Nacionales de Salud requieren un plan de gestión y compartir datos, se asume que los datos federales subyacentes permanecerán disponibles. Si un conjunto de datos del CDC desaparece en medio del proyecto, un investigador principal puede no ser capaz de satisfacer el requisito de compartir sin archivar una copia que cargue con sus propios problemas de procedencia.Nuestros informes previos sobre la terminación de las subvenciones de NIHy a los cambios a largo plazo de acceso abierto queNIH y mandatos de intercambio de datos de la UEpuesto en movimiento.
Los revisores de revistas ahora se quedan preguntando una nueva pregunta: ¿dónde están los datos de origen? Un manuscrito puede citar una URL del CDC que ya no resuelve. Una copia archivada puede responder a la pregunta, pero sólo si los autores documentaron la versión. Esa documentación aún no es la práctica estándar en la mayoría de departamentos universitarios.
Pasos prácticos para los equipos de investigación y los jefes de departamento
Este es el punto donde mi viejo instinto era hacer una lista de verificación y llamarla una política. Las listas de verificación ayudan, pero sólo si resuelven el problema real del flujo de trabajo. El problema del flujo de trabajo aquí es simple: los investigadores tratan las URL de origen como permanentes, y no son permanentes. Los pasos a continuación son el mínimo que un grupo de investigación debe hacer antes de comenzar el análisis de datos de salud federales.
- Descargue el conjunto de datos y guarde el archivo original, el diccionario de variables y una captura de pantalla de la página de acceso el día en que la recuperó.
- Grabe la URL, la fecha de acceso y un checksum para cada archivo que planea utilizar en la publicación.
- Deporte una copia versionada en un repositorio institucional o un archivo de la comunidad como DataLumos, incluso si el archivo fuente todavía está en línea.
- Si un conjunto de datos desaparece en medio del proyecto, informe al oficial del programa y al editor de la revista al mismo tiempo, con una copia archivada adjunta.
- Agregue una frase a su plan de gestión de datos que denomina un retroceso de archivo para cada conjunto de datos federal del que depende el proyecto.
Este no es un trabajo glamuroso.Es el equivalente académico de comprobar sus baterías de alarma de humo.Pero es lo que convierte una purga de datos de un evento de finalización de la publicación en un problema de citas solucionable.
La redundancia es la única forma de confianza que tiene un conjunto de datos.
Las agencias federales pueden restaurar más páginas, pero el episodio ya ha cambiado la forma en que los investigadores universitarios presupuestan su confianza.Un conjunto de datos ahora necesita al menos dos hogares antes de que se considere estable: el portal oficial y un archivo independiente con una procedencia clara.
Había pensado que la conservación de datos era el trabajo de la agencia que produjo los datos. Yo estaba equivocado en la forma cómoda en que las personas están equivocadas acerca de cosas que nunca se han roto antes. Los investigadores y bibliotecarios que han pasado el último año construyendo espejos no están acumulando. Están haciendo el mantenimiento unglamorous que hace que la ciencia sea reproducible.
Photo by Nisuda Nirmantha on Unsplash
