Academic Jobs - Home of Higher Ed Logo

Les suppressions de données de santé fédérales créent une crise de disponibilité des données de recherche

Poster une histoire
120vues
Native advertising — guest articles from $400See packages
text
Photo by KOBU Agency on Unsplash

Le 31 janvier 2025, les Centers for Disease Control and Prevention ont commencé à supprimer les pages et les outils de données contenant des termes marqués dans un mémorandum du 29 janvier de l'Office of Personnel Management des États-Unis. En quelques jours, les suppressions avaient atteint l'Administration des aliments et des médicaments, les Instituts nationaux de la santé, et d'autres parties du Département de la santé et des services humains. Jusqu'à la première semaine de février, les chercheurs qui suivaient le contenu du site de la santé fédérale ont compté plus de 8 000 pages qui avaient disparu.

Personne ne vous dit que les données de santé fédérales peuvent disparaître plus rapidement qu'une date limite de subvention vous échappe. J'ai appris cela de la manière difficile. Il y a des années, j'ai supposé qu'un fichier d'enquête gouvernementale resterait à la même URL pour toujours. Ma stratégie de sauvegarde était l'espoir. L'espoir n'est pas un plan de conservation, et c'est l'année beaucoup de gens ont trouvé que de la même manière que je l'ai fait.

Ce qui suit est une crise de la disponibilité des données de recherche.La phrase n'est pas synonyme d'un site web cassé.Il décrit une situation où un ensemble de données existe, ou existait, mais la version dont un chercheur a besoin n'est plus fiablement accessible, citable, ou comparable à la version utilisée dans l'analyse antérieure.

Les retraits ont commencé avec un mémorandum et se sont terminés dans une salle de justice fédérale.

Le mémorandum du 29 janvier 2025 de l'Office of Personnel Management a ordonné aux agences de supprimer des documents liés à ce qu'elles appellent l'idéologie du genre des systèmes visant le public. Le personnel du CDC a été invité à tirer des pages contenant des mots tels que le genre, le transgenre, l'équité, l'inclusion, et d'autres. Un juge fédéral a intervenu le 11 février 2025, ordonnant au CDC et à la FDA de restaurer les pages supprimées en vertu de la directive. La décision n'a pas tout restauré.

Ce qui a rendu cela différent d'un redesign de site Web ordinaire était l'échelle et l'absence d'avertissement. Les produits statistiques fédéraux sont censés être préparés et publiés en vertu de politiques qui les protègent de l'ingérence politique. Les chercheurs planifient des études, écrivent des demandes de subvention et calibrent des modèles autour de l'attente que les fichiers du système de surveillance du comportement des jeunes 2021 seront toujours disponibles lorsque les analyses 2025 commencent.

Une crise de disponibilité des données signifie le contrôle des versions, pas seulement des liens cassés

Pensez à un ensemble de données gouvernementales comme une carte de recette familiale.Si quelqu'un redistribue la carte et change un ingrédient mais conserve le même titre, la casserole a un goût différent et personne ne peut dire exactement pourquoi.La même chose se produit lorsque un fichier d'enquête sur la santé publique est supprimé, édité et reposté sans un historique de version clair.Les chercheurs peuvent finir par comparer les estimations qui n'ont pas été construites sur le même dénominateur ou la même formulation.

Le problème n'est pas que les agences fédérales n'actualisent jamais les ensembles de données. Ils le font, et une bonne version est une partie de leur travail. Le problème est que les suppressions ont été rapides, la documentation était mince, et les URL d'origine ont souvent cessé de résoudre. Pour une équipe de recherche universitaire, ce n'est pas un inconvénient. C'est une menace pour la réplication, pour l'examen par les pairs, et pour l'intégrité de la recherche de santé publique longitudinale.

Les datasets sous la tension la plus aiguë

Parmi les outils marqués par les chercheurs au cours des premières semaines de février figuraient le système de surveillance du comportement des risques de la jeunesse du CDC, connu sous le nom de YRBSS, qui suit les comportements de risque de santé chez les adolescents; l'indice de vulnérabilité sociale, largement utilisé dans la préparation aux catastrophes et la recherche sur l'équité de la santé; et le portail AtlasPlus pour le VIH, l'hépatite virale, la tuberculose et les données de surveillance des maladies sexuellement transmissibles.

  • Les fichiers YRBSS et les outils de requête que les chercheurs en santé utilisent pour suivre les tendances en matière de dépression, de vapotage et de comportement en matière de santé sexuelle.
  • L'indice de vulnérabilité sociale, qui combine les variables du recensement en une seule mesure utilisée par les planificateurs d'urgence et les chercheurs universitaires qui étudient les résultats des catastrophes.
  • Le portail AtlasPlus, où les départements de santé de l’État et de la région construisent des courbes d’épidémie et comparent les taux entre les comtés.
  • Pages de différences de santé et de déterminants sociaux qui fournissent la documentation des variables utilisées dans les études financées.

Une page retournant avec une nouvelle langue n'est pas la même chose qu'un ensemble de données retournant avec son dictionnaire de variables d'origine.Même quand un fichier est revenu, les chercheurs ont dû vérifier si les noms de variables, le code et le texte du questionnaire correspondaient à la version qu'ils avaient cité dans un manuscrit ou une subvention.

Les bibliothécaires de données universitaires sont devenus le système de sauvegarde par défaut

En quelques jours, les bibliothécaires de données et les organisations de recherche ont commencé à traiter les suppressions de données comme une urgence d'archivage.Le Projet de sauvetage des données, un effort communautaire coordonné par des professionnels des données, publie des lignes directrices et recueille des copies des ensembles de données fédéraux à risque.Le projet de sauvetage de donnéesIl s’agissait de l’un des moyens les plus rapides pour atteindre cet objectif.Les chercheurs ont égalementDataLumière, un archive ouvert construit pour les données du secteur public, et à Harvard Dataverse pour les dépôts de version.Fin du terme Web ArchiveIl a été fouiller les sites fédéraux sur les changements d'administration depuis 2008, et ses snapshots sont soudainement devenus l'infrastructure de travail pour les articles scientifiques.

Les bibliothèques universitaires font maintenant face à un renversement des rôles. Au lieu de pointer les chercheurs vers les portails gouvernementaux, ils stockent les copies dont les chercheurs ont besoin. Ce changement est bon, mais il place les bibliothèques dans une position qu'elles ne peuvent pas maintenir elles-mêmes.

Pour la publication et la conformité des subventions, les données source manquantes constituent désormais un risque de flux de travail

Le côté de financement de cette crise n'est pas séparé du côté des données. Lorsque le National Institutes of Health exige un plan de gestion et de partage des données, il suppose que les données fédérales sous-jacentes resteront disponibles. Si un ensemble de données CDC disparaît au milieu du projet, un chercheur principal peut ne pas être en mesure de satisfaire à l'exigence de partage sans archiver une copie qui porte ses propres problèmes de provenance.nos rapports antérieurs sur les cessations de subventions de NIHet aux changements d'accès ouvert de longue date queNIH et mandats de partage de données de l'UEMise en mouvement.

Un manuscrit peut citer une URL CDC qui ne résout plus. Une copie archivée peut répondre à la question, mais seulement si les auteurs ont documenté la version. Cette documentation n'est pas encore la pratique standard dans la plupart des départements universitaires.

Étapes pratiques pour les équipes de recherche et les chefs de département

C'est le point où mon ancien instinct était de faire une liste de contrôle et de l'appeler une politique. Les listes de contrôle aident, mais seulement si elles résolvent le problème réel du flux de travail. Le problème du flux de travail ici est simple: les chercheurs traitent les URL de source comme permanents, et ils ne sont pas permanents. Les étapes ci-dessous sont le minimum qu'un groupe de recherche devrait faire avant de commencer l'analyse sur les données de santé fédérales.

  • Téléchargez l'ensemble de données et conservez le fichier d'origine, le dictionnaire des variables et une capture d'écran de la page d'accès le jour où vous l'avez récupéré.
  • Enregistrez l'URL, la date d'accès et une somme de contrôle pour chaque fichier que vous prévoyez d'utiliser dans la publication.
  • Déposez une copie versionnée dans un dépôt institutionnel ou une archive communautaire telle que DataLumos, même si le fichier source est toujours en ligne.
  • Si un ensemble de données disparaît au milieu du projet, dites-le à l’agent du programme et à l’éditeur du journal en même temps, avec une copie archivée jointe.
  • Ajoutez une phrase à votre plan de gestion de données en nommant un casse-tête d’archivage pour chaque ensemble de données fédéral sur lequel le projet dépend.

Ce n'est pas un travail glamour.C'est l'équivalent académique de vérifier vos batteries d'alarme à la fumée.Mais c'est ce qui transforme un nettoyage de données d'un événement de fin de publication en un problème de citation résoluble.

Le licenciement est la seule forme de confiance dont dispose un ensemble de données.

Les agences fédérales peuvent restaurer plus de pages, mais l'épisode a déjà changé la façon dont les chercheurs universitaires budgétisent leur confiance.Un ensemble de données a maintenant besoin d'au moins deux maisons avant qu'il ne soit considéré comme stable: le portail officiel et un archive indépendant avec une provenance claire.

J'ai pensé que la conservation des données était le travail de l'agence qui a produit les données. J'ai eu tort dans la façon confortable que les gens ont tort au sujet de choses qui n'ont jamais été brisées avant. Les chercheurs et les bibliothécaires qui ont passé l'année dernière à construire des miroirs ne s'accumulent pas. Ils font la maintenance inégalée qui rend la science reproductible. L'espoir n'a jamais été un plan de conservation; la redondance, il s'avère, en fait.

Portrait de Dr. Liam Whitaker
A propos de l'auteur

Dr. Liam WhitakerVoir auteur

Academic Jobs In House Author

Discussions

Sort par :

Soyez le premier à commenter cet article !

vous

Vous serez invité à vous connecter avant de publier votre commentaire.

Nouvelle0 comments

Rejoignez la conversation !

Ajoutez vos commentaires dès maintenant !

Avoir votre mot

Niveau d’engagement

Browse par faculté

Browse par sujet

Frequently Asked Questions

📉Quelles purges de données de santé fédérales ont eu lieu en 2025 ?

Le 31 janvier 2025, le CDC a commencé à supprimer des pages et des outils de données après un mémo du 29 janvier de la direction du personnel des États-Unis. Début février, les chercheurs avaient déjà compté plus de 8 000 pages manquantes sur les sites du CDC, de la FDA et du HHS. Un juge fédéral a ensuite ordonné la restauration de certaines pages.

🧪Quels ensembles de données du CDC ont été les plus touchés ?

Les suppressions ont affecté le Système de surveillance du comportement à risque des jeunes, l'indice de vulnérabilité sociale, le portail AtlasPlus pour le VIH et les maladies associées, ainsi que les pages sur les disparités en matière de santé. Ces outils sont largement utilisés par les chercheurs universitaires, les services de santé locaux et les planificateurs de réponse aux catastrophes.

⚖️Les pages fédérales de santé supprimées ont-elles été rétablies ?

Le juge de district des États-Unis John D. Bates a ordonné au CDC et à la FDA de rétablir les pages le 11 février 2025. De nombreuses pages sont revenues, mais certaines sont revenues avec des formulations modifiées ou sans les fichiers de données sous-jacents. Les chercheurs sont toujours confrontés à des liens cassés et à des ensembles de données manquants.

🔍Pourquoi les chercheurs parlent-ils d'une crise de disponibilité des données ?

La crise concerne le contrôle des versions et les sources citables, et non seulement les liens cassés. Lorsqu'un jeu de données est supprimé, édité et réaffiché sans documentation claire, les chercheurs ne peuvent pas déterminer si les comparaisons de tendances utilisent les mêmes variables et dénominateurs.

🗄️Où les chercheurs peuvent-ils trouver des données de santé fédérales archivées ?

Les archives de la communauté incluent le Data Rescue Project, DataLumos, Harvard Dataverse et l'archive web de fin de mandat d'Internet Archive. Les dépôts institutionnels des universités conservent également des copies versionnées.

🏥À quoi servait l'indice de vulnérabilité sociale ?

L'indice de vulnérabilité sociale combine des variables du recensement en une seule mesure de vulnérabilité communautaire. Les planificateurs d'urgence l'utilisent en cas de catastrophe, et les chercheurs universitaires l'utilisent pour étudier les résultats en matière de santé, les expositions environnementales et la reprise après des événements météorologiques extrêmes.

🧾Comment les données fédérales manquantes affectent-elles la conformité aux subventions du NIH ?

La politique de gestion et de partage des données du NIH suppose que les données sources fédérales resteront accessibles. Si un jeu de données disparaît, une équipe de subvention peut devoir déposer une copie archivée et documenter sa provenance pour satisfaire les attentes de partage et de reproductibilité.

🛟Que doit faire une équipe de recherche si un jeu de données disparaît en cours de projet ?

Arrêtez l'analyse et documentez ce qui manque. Contactez ensuite le responsable de programme et le rédacteur en chef de la revue avec une copie archivée, l'URL originale, la date d'accès et le checksum. Une copie locale versionnée est la protection la plus solide.

📚Comment les bibliothécaires de données universitaires réagissent-ils ?

Les bibliothécaires de données sont passés de la fourniture de liens vers les portails fédéraux à la conservation et à la vérification de copies. Ils rédigent des lignes directrices sur les dates de capture, les sommes de contrôle et les historiques de versions afin que les copies archivées répondent aux normes de publication.

🔁La purge des données de santé fédérales est-elle susceptible de se reproduire ?

Personne ne peut garantir qu'il n'y aura pas un autre retrait. La réponse pratique est la redondance : conservez des copies de source officielle et des copies d'archives indépendantes, et traitez l'URL comme temporaire plutôt que permanente.