Le 31 janvier 2025, les Centers for Disease Control and Prevention ont commencé à supprimer les pages et les outils de données contenant des termes marqués dans un mémorandum du 29 janvier de l'Office of Personnel Management des États-Unis. En quelques jours, les suppressions avaient atteint l'Administration des aliments et des médicaments, les Instituts nationaux de la santé, et d'autres parties du Département de la santé et des services humains. Jusqu'à la première semaine de février, les chercheurs qui suivaient le contenu du site de la santé fédérale ont compté plus de 8 000 pages qui avaient disparu.
Personne ne vous dit que les données de santé fédérales peuvent disparaître plus rapidement qu'une date limite de subvention vous échappe. J'ai appris cela de la manière difficile. Il y a des années, j'ai supposé qu'un fichier d'enquête gouvernementale resterait à la même URL pour toujours. Ma stratégie de sauvegarde était l'espoir. L'espoir n'est pas un plan de conservation, et c'est l'année beaucoup de gens ont trouvé que de la même manière que je l'ai fait.
Ce qui suit est une crise de la disponibilité des données de recherche.La phrase n'est pas synonyme d'un site web cassé.Il décrit une situation où un ensemble de données existe, ou existait, mais la version dont un chercheur a besoin n'est plus fiablement accessible, citable, ou comparable à la version utilisée dans l'analyse antérieure.
Les retraits ont commencé avec un mémorandum et se sont terminés dans une salle de justice fédérale.
Le mémorandum du 29 janvier 2025 de l'Office of Personnel Management a ordonné aux agences de supprimer des documents liés à ce qu'elles appellent l'idéologie du genre des systèmes visant le public. Le personnel du CDC a été invité à tirer des pages contenant des mots tels que le genre, le transgenre, l'équité, l'inclusion, et d'autres. Un juge fédéral a intervenu le 11 février 2025, ordonnant au CDC et à la FDA de restaurer les pages supprimées en vertu de la directive. La décision n'a pas tout restauré.
Ce qui a rendu cela différent d'un redesign de site Web ordinaire était l'échelle et l'absence d'avertissement. Les produits statistiques fédéraux sont censés être préparés et publiés en vertu de politiques qui les protègent de l'ingérence politique. Les chercheurs planifient des études, écrivent des demandes de subvention et calibrent des modèles autour de l'attente que les fichiers du système de surveillance du comportement des jeunes 2021 seront toujours disponibles lorsque les analyses 2025 commencent.
Une crise de disponibilité des données signifie le contrôle des versions, pas seulement des liens cassés
Pensez à un ensemble de données gouvernementales comme une carte de recette familiale.Si quelqu'un redistribue la carte et change un ingrédient mais conserve le même titre, la casserole a un goût différent et personne ne peut dire exactement pourquoi.La même chose se produit lorsque un fichier d'enquête sur la santé publique est supprimé, édité et reposté sans un historique de version clair.Les chercheurs peuvent finir par comparer les estimations qui n'ont pas été construites sur le même dénominateur ou la même formulation.
Le problème n'est pas que les agences fédérales n'actualisent jamais les ensembles de données. Ils le font, et une bonne version est une partie de leur travail. Le problème est que les suppressions ont été rapides, la documentation était mince, et les URL d'origine ont souvent cessé de résoudre. Pour une équipe de recherche universitaire, ce n'est pas un inconvénient. C'est une menace pour la réplication, pour l'examen par les pairs, et pour l'intégrité de la recherche de santé publique longitudinale.
Les datasets sous la tension la plus aiguë
Parmi les outils marqués par les chercheurs au cours des premières semaines de février figuraient le système de surveillance du comportement des risques de la jeunesse du CDC, connu sous le nom de YRBSS, qui suit les comportements de risque de santé chez les adolescents; l'indice de vulnérabilité sociale, largement utilisé dans la préparation aux catastrophes et la recherche sur l'équité de la santé; et le portail AtlasPlus pour le VIH, l'hépatite virale, la tuberculose et les données de surveillance des maladies sexuellement transmissibles.
- Les fichiers YRBSS et les outils de requête que les chercheurs en santé utilisent pour suivre les tendances en matière de dépression, de vapotage et de comportement en matière de santé sexuelle.
- L'indice de vulnérabilité sociale, qui combine les variables du recensement en une seule mesure utilisée par les planificateurs d'urgence et les chercheurs universitaires qui étudient les résultats des catastrophes.
- Le portail AtlasPlus, où les départements de santé de l’État et de la région construisent des courbes d’épidémie et comparent les taux entre les comtés.
- Pages de différences de santé et de déterminants sociaux qui fournissent la documentation des variables utilisées dans les études financées.
Une page retournant avec une nouvelle langue n'est pas la même chose qu'un ensemble de données retournant avec son dictionnaire de variables d'origine.Même quand un fichier est revenu, les chercheurs ont dû vérifier si les noms de variables, le code et le texte du questionnaire correspondaient à la version qu'ils avaient cité dans un manuscrit ou une subvention.
Les bibliothécaires de données universitaires sont devenus le système de sauvegarde par défaut
En quelques jours, les bibliothécaires de données et les organisations de recherche ont commencé à traiter les suppressions de données comme une urgence d'archivage.Le Projet de sauvetage des données, un effort communautaire coordonné par des professionnels des données, publie des lignes directrices et recueille des copies des ensembles de données fédéraux à risque.Le projet de sauvetage de donnéesIl s’agissait de l’un des moyens les plus rapides pour atteindre cet objectif.Les chercheurs ont égalementDataLumière, un archive ouvert construit pour les données du secteur public, et à Harvard Dataverse pour les dépôts de version.Fin du terme Web ArchiveIl a été fouiller les sites fédéraux sur les changements d'administration depuis 2008, et ses snapshots sont soudainement devenus l'infrastructure de travail pour les articles scientifiques.
Les bibliothèques universitaires font maintenant face à un renversement des rôles. Au lieu de pointer les chercheurs vers les portails gouvernementaux, ils stockent les copies dont les chercheurs ont besoin. Ce changement est bon, mais il place les bibliothèques dans une position qu'elles ne peuvent pas maintenir elles-mêmes.
Pour la publication et la conformité des subventions, les données source manquantes constituent désormais un risque de flux de travail
Le côté de financement de cette crise n'est pas séparé du côté des données. Lorsque le National Institutes of Health exige un plan de gestion et de partage des données, il suppose que les données fédérales sous-jacentes resteront disponibles. Si un ensemble de données CDC disparaît au milieu du projet, un chercheur principal peut ne pas être en mesure de satisfaire à l'exigence de partage sans archiver une copie qui porte ses propres problèmes de provenance.nos rapports antérieurs sur les cessations de subventions de NIHet aux changements d'accès ouvert de longue date queNIH et mandats de partage de données de l'UEMise en mouvement.
Un manuscrit peut citer une URL CDC qui ne résout plus. Une copie archivée peut répondre à la question, mais seulement si les auteurs ont documenté la version. Cette documentation n'est pas encore la pratique standard dans la plupart des départements universitaires.
Étapes pratiques pour les équipes de recherche et les chefs de département
C'est le point où mon ancien instinct était de faire une liste de contrôle et de l'appeler une politique. Les listes de contrôle aident, mais seulement si elles résolvent le problème réel du flux de travail. Le problème du flux de travail ici est simple: les chercheurs traitent les URL de source comme permanents, et ils ne sont pas permanents. Les étapes ci-dessous sont le minimum qu'un groupe de recherche devrait faire avant de commencer l'analyse sur les données de santé fédérales.
- Téléchargez l'ensemble de données et conservez le fichier d'origine, le dictionnaire des variables et une capture d'écran de la page d'accès le jour où vous l'avez récupéré.
- Enregistrez l'URL, la date d'accès et une somme de contrôle pour chaque fichier que vous prévoyez d'utiliser dans la publication.
- Déposez une copie versionnée dans un dépôt institutionnel ou une archive communautaire telle que DataLumos, même si le fichier source est toujours en ligne.
- Si un ensemble de données disparaît au milieu du projet, dites-le à l’agent du programme et à l’éditeur du journal en même temps, avec une copie archivée jointe.
- Ajoutez une phrase à votre plan de gestion de données en nommant un casse-tête d’archivage pour chaque ensemble de données fédéral sur lequel le projet dépend.
Ce n'est pas un travail glamour.C'est l'équivalent académique de vérifier vos batteries d'alarme à la fumée.Mais c'est ce qui transforme un nettoyage de données d'un événement de fin de publication en un problème de citation résoluble.
Le licenciement est la seule forme de confiance dont dispose un ensemble de données.
Les agences fédérales peuvent restaurer plus de pages, mais l'épisode a déjà changé la façon dont les chercheurs universitaires budgétisent leur confiance.Un ensemble de données a maintenant besoin d'au moins deux maisons avant qu'il ne soit considéré comme stable: le portail officiel et un archive indépendant avec une provenance claire.
J'ai pensé que la conservation des données était le travail de l'agence qui a produit les données. J'ai eu tort dans la façon confortable que les gens ont tort au sujet de choses qui n'ont jamais été brisées avant. Les chercheurs et les bibliothécaires qui ont passé l'année dernière à construire des miroirs ne s'accumulent pas. Ils font la maintenance inégalée qui rend la science reproductible. L'espoir n'a jamais été un plan de conservation; la redondance, il s'avère, en fait.
Photo by Nisuda Nirmantha on Unsplash
