Em 31 de janeiro de 2025, os Centros de Controle e Prevenção de Doenças começaram a remover páginas e ferramentas de dados que continham termos marcados em um memorando de 29 de janeiro do Escritório de Gestão de Pessoal dos EUA. Em poucos dias, as remoções tinham chegado à Administração de Alimentos e Medicamentos, aos Institutos Nacionais de Saúde e a outras partes do Departamento de Saúde e Serviços Humanos. Até a primeira semana de fevereiro, pesquisadores que rastreavam o conteúdo da web de saúde federal contaram mais de 8.000 páginas que haviam desaparecido.
Ninguém lhe diz que os dados de saúde federais podem desaparecer mais rápido do que um prazo de concessão se esconde em você. Aprendi isso da maneira difícil. Anos atrás, eu assumia que um arquivo de pesquisa do governo ficaria no mesmo URL para sempre. Minha estratégia de backup era esperança. Esperança não é um plano de preservação, e este é o ano que muitas pessoas descobriram que da mesma maneira que eu fiz.
A frase não é sinônimo de um site quebrado. Descreve uma situação em que um conjunto de dados existe, ou existiu, mas a versão que um pesquisador precisa não é mais acessível de forma confiável, citável ou comparável à versão usada na análise anterior.
As remoções começaram com um memorando e terminaram em um tribunal federal
O memorando de 29 de janeiro de 2025 do Escritório de Gestão de Pessoal instruiu as agências a remover materiais relacionados com o que chamou de ideologia de gênero dos sistemas de acesso público. O pessoal do CDC foi instruído a retirar páginas contendo palavras como gênero, transgênero, equidade, inclusão e outros. Um juiz federal entrou em 11 de fevereiro de 2025, ordenando que o CDC e a FDA restaurassem as páginas removidas sob a diretiva.
O que fez isso diferente de um redesenho de site comum foi a escala e a ausência de aviso. Produtos estatísticos federais devem ser preparados e lançados sob políticas que os protejam da interferência política. Pesquisadores planejam estudos, escrevem pedidos de subvenção e calibram modelos em torno da expectativa de que os arquivos do sistema de vigilância do comportamento de jovens de 2021 ainda estarão disponíveis quando as análises de 2025 começarem.
Uma crise de disponibilidade de dados significa controle de versão, não apenas links quebrados
Pense em um conjunto de dados do governo como um cartão de receita familiar.Se alguém retipe o cartão e altera um ingrediente, mas mantém o mesmo título, a panela tem um sabor diferente e ninguém pode dizer exatamente por que.O mesmo acontece quando um arquivo de pesquisa de saúde pública é removido, editado e repostado sem um histórico de versão claro.Os pesquisadores podem acabar comparando estimativas que não foram construídas sobre o mesmo denominador ou a mesma formulação.
O problema não é que as agências federais nunca atualizam conjuntos de dados. Eles fazem, e uma boa versão faz parte de seu trabalho. O problema é que as remoções foram rápidas, a documentação era fina e os URLs originais muitas vezes pararam de resolver. Para uma equipe de pesquisa universitária, isso não é um inconveniente. É uma ameaça à replicação, à revisão por pares e à integridade da pesquisa de saúde pública longitudinal.
Os conjuntos de dados sob a tensão mais aguda
Entre as ferramentas que os pesquisadores marcaram nas primeiras semanas de fevereiro foram o Sistema de Vigilância do Comportamento de Riscos da Juventude do CDC, conhecido como YRBSS, que rastreia comportamentos de risco de saúde entre adolescentes; o Índice de Vulnerabilidade Social, amplamente utilizado na preparação para desastres e pesquisa de equidade de saúde; e o portal AtlasPlus para HIV, hepatite viral, tuberculose e dados de vigilância de doenças sexualmente transmissíveis.
- Os arquivos YRBSS e ferramentas de consulta que os pesquisadores de saúde da escola usam para rastrear tendências em depressão, vaping e comportamento de saúde sexual.
- O Índice de Vulnerabilidade Social, que combina variáveis do censo em uma única medida usada por planejadores de emergências e pesquisadores universitários que estudam os resultados de desastres.
- O portal AtlasPlus, onde os departamentos de saúde estaduais e locais criam curvas de epidemia e comparam as taxas entre os condados.
- Diferenças de saúde e determinantes sociais páginas que forneceram documentação para variáveis usadas em estudos financiados.
Uma página que retorna com um novo idioma não é o mesmo que um conjunto de dados que retorna com seu dicionário de variáveis originais.Mesmo quando um arquivo voltou, os pesquisadores tiveram que verificar se os nomes das variáveis, codificação e texto do questionário correspondem à versão que tinham citado em um manuscrito ou doação.
Bibliotecários de dados universitários se tornaram o sistema de backup por padrão
Em poucos dias, bibliotecários de dados e organizações de pesquisa de dados começaram a tratar as remoções como uma emergência de arquivo.O Data Rescue Project, um esforço comunitário coordenado por profissionais de dados, publica orientações e coleta cópias de conjuntos de dados federais em risco.Projeto de Resgate de Dadosfoi um dos caminhos mais rápidos para esse trabalho. os pesquisadores também seDados, um arquivo aberto construído para dados do setor público, e para o Harvard Dataverse para depósitos de versões.Fim do termo Arquivo WebOs sites federais foram rastreados em mudanças de administração desde 2008, e suas imagens instantâneas de repente se tornaram a infraestrutura de trabalho para artigos científicos.
Bibliotecas universitárias agora enfrentam uma reversão de papéis. Em vez de apontar pesquisadores para portais do governo, eles estão armazenando as cópias que os pesquisadores precisam. Essa mudança é boa, mas coloca bibliotecas em uma posição que eles não podem sustentar por conta própria. cópias de arquivo são apenas tão úteis quanto os metadados ao seu redor: quem capturou o arquivo, quando, a partir de qual URL, e com que checksum.
Para a conformidade de publicação e concessão, os dados de origem perdidos são agora um risco de fluxo de trabalho
O lado de financiamento desta crise não é separado do lado de dados. Quando os Institutos Nacionais de Saúde requerem um plano de gerenciamento e compartilhamento de dados, assume que os dados federais subjacentes permanecerão disponíveis. Se um conjunto de dados do CDC desaparecer no meio do projeto, um investigador principal pode não ser capaz de satisfazer o requisito de compartilhamento sem arquivar uma cópia que carrega seus próprios problemas de origem.Nossos relatórios anteriores sobre os encerramentos de subsídios NIHe às mudanças de acesso aberto de longa data que oNIH e mandatos de partilha de dados da UEcolocado em movimento.
Os revisores de jornais são agora deixados para fazer uma nova pergunta: onde estão os dados de origem? Um manuscrito pode citar um URL do CDC que já não resolve. Uma cópia arquivada pode responder à pergunta, mas apenas se os autores documentaram a versão. Essa documentação ainda não é a prática padrão na maioria dos departamentos universitários. Os editores não se estabeleceram em um formato de citação universal para conjuntos de dados que experimentaram uma purga federal.
Passos práticos para equipes de pesquisa e chefes de departamento
Este é o ponto em que meu velho instinto era fazer uma lista de verificação e chamá-la de uma política. Listas de verificação ajudam, mas apenas se resolverem o problema real do fluxo de trabalho. O problema do fluxo de trabalho aqui é simples: os pesquisadores tratam URLs de origem como permanentes, e eles não são permanentes. Os passos abaixo são o mínimo que um grupo de pesquisa deve fazer antes de começar a análise de dados de saúde federais.
- Faça o download do conjunto de dados e guarde o arquivo original, o dicionário de variáveis e uma captura de tela da página de acesso no dia em que você o recuperou.
- Registre o URL, a data de acesso e um checksum para cada arquivo que você planeja usar na publicação.
- Armazene uma cópia de versão em um repositório institucional ou em um arquivo da comunidade, como o DataLumos, mesmo que o arquivo-fonte ainda esteja online.
- Se um conjunto de dados desaparecer no meio do projeto, informe o seu oficial do programa e o editor da revista ao mesmo tempo, com uma cópia arquivada anexada.
- Adicione uma sentença ao seu plano de gerenciamento de dados nomeando uma falha de arquivo para cada conjunto de dados federal que o projeto depende.
Este não é um trabalho glamouroso.É o equivalente acadêmico de verificar suas baterias de alarme de fumaça.Mas é o que transforma uma limpeza de dados de um evento de final de publicação em um problema de citação resolvível.
O despedimento é a única forma de confiança que um conjunto de dados tem
As agências federais podem restaurar mais páginas, mas o episódio já mudou a forma como os pesquisadores universitários orçam sua confiança.Um conjunto de dados agora precisa de pelo menos duas casas antes de ser considerado estável: o portal oficial e um arquivo independente com proveniência clara.
Eu costumava pensar que a preservação de dados era o trabalho da agência que produziu os dados. Eu estava errado na maneira confortável que as pessoas estão erradas sobre coisas que nunca haviam quebrado antes. Os pesquisadores e bibliotecários que passaram o último ano construindo espelhos não estão acumulando. Eles estão fazendo a manutenção unglamorous que torna a ciência reproduzível. Esperança nunca foi um plano de preservação; redundância, acaba por ser, na verdade é.
Photo by Nisuda Nirmantha on Unsplash
