Academic Jobs - Home of Higher Ed Logo

Bundesweite Löschung von Gesundheitsdaten führt zu einer Krise der Datenverfügbarkeit in der Forschung

Postet eine Geschichte
120Ansichten
Native advertising — guest articles from $400See packages
text
Photo by KOBU Agency on Unsplash

Am 31. Januar 2025 begannen die Zentren für Krankheitskontrolle und Prävention, Seiten und Datenwerkzeuge zu entfernen, die Begriffe enthielten, die in einem 29. Januar-Memo des US-Büros für Personalmanagement gekennzeichnet waren. Innerhalb von Tagen hatten die Entnahmen die Food and Drug Administration, die National Institutes of Health und andere Teile des Department of Health and Human Services erreicht. Bis zur ersten Woche im Februar zählten Forscher, die Bundesgesundheitswebinhalte verfolgten, mehr als 8.000 Seiten, die verschwunden waren.

Niemand sagt Ihnen, dass Bundesgesundheitsdaten schneller verschwinden können, als eine Zuschussfrist auf Sie schleicht. Ich habe dies auf die harte Weise gelernt. Vor Jahren habe ich angenommen, dass eine Regierungsumfrage-Datei auf der gleichen URL für immer bleiben würde. Meine Backup-Strategie war Hoffnung.

Es beschreibt eine Situation, in der ein Datensatz existiert oder existierte, aber die Version, die ein Forscher braucht, ist nicht mehr zuverlässig zugänglich, zitierbar oder vergleichbar mit der Version, die in früheren Analysen verwendet wurde.

Die Entfernung begann mit einem Memo und endete in einem Bundesgerichtssaal

Das Memorandum vom 29. Januar 2025 vom Office of Personnel Management leitete die Agenturen an, Materialien zu entfernen, die mit dem, was sie Gender-Ideologie nannte, aus öffentlich zugänglichen Systemen zusammenhängen. CDC-Mitarbeiter wurden aufgefordert, Seiten zu ziehen, die Wörter wie Geschlecht, Transgender, Gleichheit, Inklusion und andere enthielten. Ein Bundesrichter trat am 11. Februar 2025 ein und befahl CDC und der FDA, Seiten wiederherzustellen, die nach der Richtlinie entfernt wurden.

Was dies von einem gewöhnlichen Website-Neuentwurf unterscheidet, war das Ausmaß und die Abwesenheit von Benachrichtigungen. Bundesstatistiken-Produkte sollen unter Richtlinien vorbereitet und veröffentlicht werden, die sie vor politischer Einmischung schützen. Forscher planen Studien, schreiben Beihilfeanträge und kalibrieren Modelle um die Erwartung, dass die 2021 Youth Risk Behavior Surveillance System-Dateien immer noch verfügbar sein werden, wenn die 2025-Analysen beginnen.

Eine Datenverfügbarkeitskrise bedeutet Versionskontrolle, nicht nur gebrochene Links

Denken Sie an einen Regierungsdatensatz wie eine Familienrezeptkarte. Wenn jemand die Karte neu typisiert und eine Zutat ändert, aber den gleichen Titel behält, schmeckt die Casserole anders und niemand kann genau sagen, warum. Das gleiche passiert, wenn eine öffentliche Gesundheitsumfrage-Datei entfernt, bearbeitet und ohne eine klare Versionshistorie neu veröffentlicht wird.

Das Problem ist nicht, dass Bundesagenturen niemals Datensätze aktualisieren. Sie tun es, und gute Versionierung ist Teil ihrer Arbeit. Das Problem ist, dass die Entfernungen schnell waren, die Dokumentation dünn war und die ursprünglichen URLs oft aufgehört haben zu lösen. Für ein Forschungsteam der Universität ist das kein Unbehagen. Es ist eine Bedrohung für die Replikation, für Peer-Review und für die Integrität der länglichen öffentlichen Gesundheitsforschung.

Die Datensätze unter der schärfsten Belastung

Unter den Werkzeugen, die die Forscher in den ersten Wochen des Februar markierten, waren das CDC Youth Risk Behavior Surveillance System, bekannt als YRBSS, das Gesundheitsrisikoverhalten bei Jugendlichen verfolgt; der Social Vulnerability Index, der weit verbreitet in der Katastrophenvorbereitung und der Gesundheits-Equity-Forschung verwendet wird; und das AtlasPlus-Portal für HIV, virale Hepatitis, Tuberkulose und sexuell übertragene Krankheitsüberwachungsdaten.

  • Die YRBSS-Dateien und Abfrage-Tools, die Schulgesundheitsforscher verwenden, um Trends in Depressionen, Vaping und sexuellem Gesundheitsverhalten zu verfolgen.
  • Der Social Vulnerability Index, der Volkszählungsvariablen in eine einzige Maßnahme kombiniert, die von Notfallplanern und Universitätsforschern verwendet wird, die Katastrophenergebnisse studieren.
  • Das AtlasPlus-Portal, in dem staatliche und lokale Gesundheitsabteilungen Epidemiekurven aufbauen und Preise in verschiedenen Grafschaften vergleichen.
  • Seiten mit gesundheitlichen Unterschieden und sozialen Determinanten, die Dokumentation für in finanzierten Studien verwendete Variablen lieferten.

Eine Seite, die mit einer neuen Sprache zurückkehrt, ist nicht dasselbe wie ein Datensatz, der mit seinem ursprünglichen variablen Wörterbuch zurückkehrt. Selbst wenn eine Datei zurückkehrte, mussten die Forscher prüfen, ob die variablen Namen, die Codierung und der Fragebogentext mit der Version übereinstimmten, die sie in einem Manuskript oder einem Grant zitiert hatten.

Universitätsdatenbibliotheken wurden standardmäßig zum Backup-System

Innerhalb von Tagen begannen Datenbibliothekare und Forschungsdatenorganisationen, die Entfernungen als Archivierungsnotstand zu behandeln.Das Data Rescue Project, eine von Datenfachleuten koordinierte Gemeinschaftsanstrengung, veröffentlicht Leitlinien und sammelt Kopien von gefährdeten Bundesdatensätzen.Das Data Rescue Projectwar einer der schnellsten Wege in diese Arbeit. Forscher wandten sich auchDatenspeicher, ein offenes Archiv für Daten des öffentlichen Sektors gebaut, und zu Harvard Dataverse für versionierte Einlagen.Ende des Begriffs Webarchivseit 2008 auf Bundesseiten bei Verwaltungswechseln geschaut hatte, und seine Snapshots wurden plötzlich zu einer Arbeitsinfrastruktur für wissenschaftliche Arbeiten.

Universitätsbibliotheken stehen nun vor einer Umkehrung der Rollen. Anstatt Forscher auf Regierungsportale zu lenken, speichern sie die Kopien, die Forscher benötigen. Diese Verschiebung ist gut, aber sie bringt Bibliotheken in eine Position, die sie nicht von selbst aufrechterhalten können. Archivkopien sind nur so nützlich wie die Metadaten um sie herum: wer die Datei erfasst hat, wann, von welcher URL und mit welcher Checksum.

Für die Veröffentlichung und die Konformität der Zuschüsse sind fehlende Quelldaten jetzt ein Workflow-Risiko

Die Finanzierungsseite dieser Krise ist nicht getrennt von der Datenseite.Wenn die National Institutes of Health ein Datenmanagement- und Sharing-Plan erfordert, geht es darum, dass die zugrunde liegenden Bundesdaten verfügbar bleiben.Wenn ein CDC-Datensatz in der Mitte des Projekts verschwindet, kann ein Hauptforscher nicht in der Lage sein, die Sharing-Anforderung zu erfüllen, ohne eine Kopie zu archivieren, die eigene Herkunftsprobleme hat.unsere frühere Berichterstattung über NIH-Zulassungenund den langfristigen Open Access-Änderungen, die dieNIH und EU-DatenaustauschmandateSet in Bewegung.

Journal-Reviewer werden nun eine neue Frage gestellt: Wo sind die Quelldaten? Ein Manuskript kann eine CDC-URL zitieren, die nicht mehr gelöst wird. Eine archivierte Kopie kann die Frage beantworten, aber nur, wenn die Autoren die Version dokumentiert haben. Diese Dokumentation ist noch nicht die Standardpraxis in den meisten Universitätsabteilungen.

Praktische Schritte für Forschungsteams und Abteilungsleiter

Checklisten helfen, aber nur, wenn sie das eigentliche Workflow-Problem lösen. Das Workflow-Problem hier ist einfach: Forscher behandeln Quell-URLs als dauerhaft, und sie sind nicht dauerhaft.

  • Laden Sie den Datensatz herunter und bewahren Sie die ursprüngliche Datei, das variable Wörterbuch und einen Screenshot der Access-Seite am Tag, an dem Sie sie abgerufen haben.
  • Speichern Sie die URL, das Datum des Zugriffs und eine Überprüfungssumme für jede Datei, die Sie in der Veröffentlichung verwenden möchten.
  • Speichern Sie eine versionierte Kopie in einem institutionellen Repository oder einem Community-Archiv wie DataLumos, auch wenn die Quelldatei noch online ist.
  • Wenn ein Datensatz in der Mitte des Projekts verschwindet, teilen Sie es Ihrem Programmbeauftragten und dem Journal-Editor gleichzeitig mit einer archivierten Kopie beigefügt.
  • Fügen Sie Ihrem Datenverwaltungsplan einen Satz hinzu, in dem ein Archivfallback für jeden bundesweiten Datensatz benannt wird, von dem das Projekt abhängt.

Dies ist keine glamouröse Arbeit.Es ist das akademische Äquivalent der Überprüfung Ihrer Rauchalarmbatterien.Aber es ist das, was eine Datenreinigung von einem Veröffentlichungsende-Ereignis in ein lösbares Zitatproblem verwandelt.

Entlassung ist die einzige Form des Vertrauens, die ein Datensatz hat

Bundesbehörden könnten mehr Seiten wiederherstellen, aber die Episode hat bereits verändert, wie Universitätsforscher ihr Vertrauen budgetieren.Ein Datensatz braucht jetzt mindestens zwei Häuser, bevor es als stabil angesehen werden sollte: das offizielle Portal und ein unabhängiges Archiv mit klarer Herkunft.

Ich dachte früher, dass die Erhaltung von Daten die Aufgabe der Agentur war, die die Daten produzierte. Ich war falsch in der bequemen Art und Weise, wie Menschen falsch über Dinge sind, die nie zuvor gebrochen haben. Die Forscher und Bibliothekare, die das vergangene Jahr damit verbracht haben, Spiegel zu bauen, sammeln nicht. Sie tun die unglückliche Wartung, die die Wissenschaft reproduzierbar macht. Hoffnung war nie ein Erhaltungsplan; Redundanz, es stellt sich heraus, ist tatsächlich.

Porträt von Dr. Liam Whitaker
Über den Autor

Dr. Liam WhitakerAutor ansehen

Academic Jobs In House Author

Diskussionen

Sort von:

Seien Sie der Erste, der diesen Artikel kommentiert!

Du bist

Sie werden gebeten, sich anzumelden, bevor Ihr Kommentar veröffentlicht wird.

Neue0 comments

Treten Sie dem Gespräch bei!

Fügen Sie jetzt Ihre Kommentare hinzu!

Haben Sie Ihr Wort

Engagement Ebene

Browse nach Fakultät

Browse nach Thema

Frequently Asked Questions

📉Welche Bundesgesundheitsdaten-Löschungen gab es 2025?

Am 31. Januar 2025 begann die CDC damit, Seiten und Datentools nach einem Memo des US-Büros für Personalmanagement vom 29. Januar zu entfernen. Anfang Februar hatten Forscher mehr als 8.000 fehlende Seiten auf den Seiten von CDC, FDA und HHS gezählt. Ein Bundesrichter ordnete später die Wiederherstellung einiger Seiten an.

🧪Welche CDC-Datensätze waren am stärksten betroffen?

Die Entfernungen betrafen das Youth Risk Behavior Surveillance System, den Social Vulnerability Index, das AtlasPlus-Portal für HIV und damit verbundene Krankheiten sowie Seiten zu Gesundheitsungleichheiten. Diese werden von Universitätsforschern, lokalen Gesundheitsbehörden und Katastrophenhilfekoordinatoren häufig genutzt.

⚖️Wurden die entfernten Bundesgesundheitsseiten wiederhergestellt?

Der US-Bezirksrichter John D. Bates ordnete am 11. Februar 2025 an, dass die CDC und FDA die Seiten wiederherstellen müssen. Viele Seiten sind zurückgekehrt, aber einige sind mit geändertem Wortlaut oder ohne die zugrunde liegenden Datendateien zurückgekehrt. Forscher stoßen immer noch auf fehlerhafte Links und fehlende Datensätze.

🔍Warum sprechen Forscher von einer Datenverfügbarkeitskrise?

Die Krise betrifft nicht nur kaputte Links, sondern auch Versionskontrolle und zitierbare Quellen. Wenn ein Datensatz entfernt, bearbeitet und ohne klare Dokumentation neu veröffentlicht wird, können Forscher nicht erkennen, ob Trendvergleiche dieselben Variablen und Nenner verwenden.

🗄️Wo können Forscher archivierte Bundesgesundheitsdaten finden?

Community-Archive umfassen das Data Rescue Project, DataLumos, Harvard Dataverse und das Internet Archive's End of Term Web Archive. Universitäre institutionelle Repositorien enthalten auch versionierte Kopien.

🏥Wofür wurde der Social Vulnerability Index verwendet?

Der Social Vulnerability Index kombiniert Volkszählungsvariablen zu einem einzigen Maß für die Verwundbarkeit einer Gemeinschaft. Notfallplaner verwenden ihn bei Katastrophen, und Universitätsforscher verwenden ihn, um Gesundheitsergebnisse, Umweltbelastungen und die Erholung nach extremen Wetterereignissen zu untersuchen.

🧾Wie wirkt sich fehlende Bundesdaten auf die Einhaltung von NIH-Fördermitteln aus?

Die NIH-Datenverwaltungs- und -Freigaberichtlinie geht davon aus, dass Bundesquellendaten weiterhin zugänglich bleiben. Wenn ein Datensatz verschwindet, muss ein Grant-Team möglicherweise eine archivierte Kopie einreichen und ihre Herkunft dokumentieren, um die Erwartungen an die gemeinsame Nutzung und Reproduzierbarkeit zu erfüllen.

🛟Was soll ein Forschungsteam tun, wenn ein Datensatz mitten im Projekt verschwindet?

Stoppen Sie die Analyse und dokumentieren Sie, was fehlt. Dann kontaktieren Sie den Programmbeauftragten und den Herausgeber der Zeitschrift mit einer archivierten Kopie, der ursprünglichen URL, dem Zugriffsdatum und der Prüfsumme. Eine versionierte lokale Kopie ist der stärkste Schutz.

📚Wie reagieren Universitätsdatenbibliothekare?

Datenbibliothekare haben sich von der Weiterleitung von Forschern zu Bundesportalen hin zur Speicherung und Überprüfung von Kopien verlagert. Sie erstellen Richtlinien zu Erfassungsdaten, Prüfsummen und Versionsverläufen, damit archivierte Kopien die Publikationsstandards erfüllen.

🔁Ist ein erneuter Datenlöschvorgang im Gesundheitswesen wahrscheinlich?

Niemand kann eine erneute Entfernung garantieren. Die praktische Antwort ist Redundanz: offizielle Quellkopien und unabhängige Archivkopien aufbewahren und die URL als temporär und nicht als dauerhaft behandeln.