Am 31. Januar 2025 begannen die Zentren für Krankheitskontrolle und Prävention, Seiten und Datenwerkzeuge zu entfernen, die Begriffe enthielten, die in einem 29. Januar-Memo des US-Büros für Personalmanagement gekennzeichnet waren. Innerhalb von Tagen hatten die Entnahmen die Food and Drug Administration, die National Institutes of Health und andere Teile des Department of Health and Human Services erreicht. Bis zur ersten Woche im Februar zählten Forscher, die Bundesgesundheitswebinhalte verfolgten, mehr als 8.000 Seiten, die verschwunden waren.
Niemand sagt Ihnen, dass Bundesgesundheitsdaten schneller verschwinden können, als eine Zuschussfrist auf Sie schleicht. Ich habe dies auf die harte Weise gelernt. Vor Jahren habe ich angenommen, dass eine Regierungsumfrage-Datei auf der gleichen URL für immer bleiben würde. Meine Backup-Strategie war Hoffnung.
Es beschreibt eine Situation, in der ein Datensatz existiert oder existierte, aber die Version, die ein Forscher braucht, ist nicht mehr zuverlässig zugänglich, zitierbar oder vergleichbar mit der Version, die in früheren Analysen verwendet wurde.
Die Entfernung begann mit einem Memo und endete in einem Bundesgerichtssaal
Das Memorandum vom 29. Januar 2025 vom Office of Personnel Management leitete die Agenturen an, Materialien zu entfernen, die mit dem, was sie Gender-Ideologie nannte, aus öffentlich zugänglichen Systemen zusammenhängen. CDC-Mitarbeiter wurden aufgefordert, Seiten zu ziehen, die Wörter wie Geschlecht, Transgender, Gleichheit, Inklusion und andere enthielten. Ein Bundesrichter trat am 11. Februar 2025 ein und befahl CDC und der FDA, Seiten wiederherzustellen, die nach der Richtlinie entfernt wurden.
Was dies von einem gewöhnlichen Website-Neuentwurf unterscheidet, war das Ausmaß und die Abwesenheit von Benachrichtigungen. Bundesstatistiken-Produkte sollen unter Richtlinien vorbereitet und veröffentlicht werden, die sie vor politischer Einmischung schützen. Forscher planen Studien, schreiben Beihilfeanträge und kalibrieren Modelle um die Erwartung, dass die 2021 Youth Risk Behavior Surveillance System-Dateien immer noch verfügbar sein werden, wenn die 2025-Analysen beginnen.
Eine Datenverfügbarkeitskrise bedeutet Versionskontrolle, nicht nur gebrochene Links
Denken Sie an einen Regierungsdatensatz wie eine Familienrezeptkarte. Wenn jemand die Karte neu typisiert und eine Zutat ändert, aber den gleichen Titel behält, schmeckt die Casserole anders und niemand kann genau sagen, warum. Das gleiche passiert, wenn eine öffentliche Gesundheitsumfrage-Datei entfernt, bearbeitet und ohne eine klare Versionshistorie neu veröffentlicht wird.
Das Problem ist nicht, dass Bundesagenturen niemals Datensätze aktualisieren. Sie tun es, und gute Versionierung ist Teil ihrer Arbeit. Das Problem ist, dass die Entfernungen schnell waren, die Dokumentation dünn war und die ursprünglichen URLs oft aufgehört haben zu lösen. Für ein Forschungsteam der Universität ist das kein Unbehagen. Es ist eine Bedrohung für die Replikation, für Peer-Review und für die Integrität der länglichen öffentlichen Gesundheitsforschung.
Die Datensätze unter der schärfsten Belastung
Unter den Werkzeugen, die die Forscher in den ersten Wochen des Februar markierten, waren das CDC Youth Risk Behavior Surveillance System, bekannt als YRBSS, das Gesundheitsrisikoverhalten bei Jugendlichen verfolgt; der Social Vulnerability Index, der weit verbreitet in der Katastrophenvorbereitung und der Gesundheits-Equity-Forschung verwendet wird; und das AtlasPlus-Portal für HIV, virale Hepatitis, Tuberkulose und sexuell übertragene Krankheitsüberwachungsdaten.
- Die YRBSS-Dateien und Abfrage-Tools, die Schulgesundheitsforscher verwenden, um Trends in Depressionen, Vaping und sexuellem Gesundheitsverhalten zu verfolgen.
- Der Social Vulnerability Index, der Volkszählungsvariablen in eine einzige Maßnahme kombiniert, die von Notfallplanern und Universitätsforschern verwendet wird, die Katastrophenergebnisse studieren.
- Das AtlasPlus-Portal, in dem staatliche und lokale Gesundheitsabteilungen Epidemiekurven aufbauen und Preise in verschiedenen Grafschaften vergleichen.
- Seiten mit gesundheitlichen Unterschieden und sozialen Determinanten, die Dokumentation für in finanzierten Studien verwendete Variablen lieferten.
Eine Seite, die mit einer neuen Sprache zurückkehrt, ist nicht dasselbe wie ein Datensatz, der mit seinem ursprünglichen variablen Wörterbuch zurückkehrt. Selbst wenn eine Datei zurückkehrte, mussten die Forscher prüfen, ob die variablen Namen, die Codierung und der Fragebogentext mit der Version übereinstimmten, die sie in einem Manuskript oder einem Grant zitiert hatten.
Universitätsdatenbibliotheken wurden standardmäßig zum Backup-System
Innerhalb von Tagen begannen Datenbibliothekare und Forschungsdatenorganisationen, die Entfernungen als Archivierungsnotstand zu behandeln.Das Data Rescue Project, eine von Datenfachleuten koordinierte Gemeinschaftsanstrengung, veröffentlicht Leitlinien und sammelt Kopien von gefährdeten Bundesdatensätzen.Das Data Rescue Projectwar einer der schnellsten Wege in diese Arbeit. Forscher wandten sich auchDatenspeicher, ein offenes Archiv für Daten des öffentlichen Sektors gebaut, und zu Harvard Dataverse für versionierte Einlagen.Ende des Begriffs Webarchivseit 2008 auf Bundesseiten bei Verwaltungswechseln geschaut hatte, und seine Snapshots wurden plötzlich zu einer Arbeitsinfrastruktur für wissenschaftliche Arbeiten.
Universitätsbibliotheken stehen nun vor einer Umkehrung der Rollen. Anstatt Forscher auf Regierungsportale zu lenken, speichern sie die Kopien, die Forscher benötigen. Diese Verschiebung ist gut, aber sie bringt Bibliotheken in eine Position, die sie nicht von selbst aufrechterhalten können. Archivkopien sind nur so nützlich wie die Metadaten um sie herum: wer die Datei erfasst hat, wann, von welcher URL und mit welcher Checksum.
Für die Veröffentlichung und die Konformität der Zuschüsse sind fehlende Quelldaten jetzt ein Workflow-Risiko
Die Finanzierungsseite dieser Krise ist nicht getrennt von der Datenseite.Wenn die National Institutes of Health ein Datenmanagement- und Sharing-Plan erfordert, geht es darum, dass die zugrunde liegenden Bundesdaten verfügbar bleiben.Wenn ein CDC-Datensatz in der Mitte des Projekts verschwindet, kann ein Hauptforscher nicht in der Lage sein, die Sharing-Anforderung zu erfüllen, ohne eine Kopie zu archivieren, die eigene Herkunftsprobleme hat.unsere frühere Berichterstattung über NIH-Zulassungenund den langfristigen Open Access-Änderungen, die dieNIH und EU-DatenaustauschmandateSet in Bewegung.
Journal-Reviewer werden nun eine neue Frage gestellt: Wo sind die Quelldaten? Ein Manuskript kann eine CDC-URL zitieren, die nicht mehr gelöst wird. Eine archivierte Kopie kann die Frage beantworten, aber nur, wenn die Autoren die Version dokumentiert haben. Diese Dokumentation ist noch nicht die Standardpraxis in den meisten Universitätsabteilungen.
Praktische Schritte für Forschungsteams und Abteilungsleiter
Checklisten helfen, aber nur, wenn sie das eigentliche Workflow-Problem lösen. Das Workflow-Problem hier ist einfach: Forscher behandeln Quell-URLs als dauerhaft, und sie sind nicht dauerhaft.
- Laden Sie den Datensatz herunter und bewahren Sie die ursprüngliche Datei, das variable Wörterbuch und einen Screenshot der Access-Seite am Tag, an dem Sie sie abgerufen haben.
- Speichern Sie die URL, das Datum des Zugriffs und eine Überprüfungssumme für jede Datei, die Sie in der Veröffentlichung verwenden möchten.
- Speichern Sie eine versionierte Kopie in einem institutionellen Repository oder einem Community-Archiv wie DataLumos, auch wenn die Quelldatei noch online ist.
- Wenn ein Datensatz in der Mitte des Projekts verschwindet, teilen Sie es Ihrem Programmbeauftragten und dem Journal-Editor gleichzeitig mit einer archivierten Kopie beigefügt.
- Fügen Sie Ihrem Datenverwaltungsplan einen Satz hinzu, in dem ein Archivfallback für jeden bundesweiten Datensatz benannt wird, von dem das Projekt abhängt.
Dies ist keine glamouröse Arbeit.Es ist das akademische Äquivalent der Überprüfung Ihrer Rauchalarmbatterien.Aber es ist das, was eine Datenreinigung von einem Veröffentlichungsende-Ereignis in ein lösbares Zitatproblem verwandelt.
Entlassung ist die einzige Form des Vertrauens, die ein Datensatz hat
Bundesbehörden könnten mehr Seiten wiederherstellen, aber die Episode hat bereits verändert, wie Universitätsforscher ihr Vertrauen budgetieren.Ein Datensatz braucht jetzt mindestens zwei Häuser, bevor es als stabil angesehen werden sollte: das offizielle Portal und ein unabhängiges Archiv mit klarer Herkunft.
Ich dachte früher, dass die Erhaltung von Daten die Aufgabe der Agentur war, die die Daten produzierte. Ich war falsch in der bequemen Art und Weise, wie Menschen falsch über Dinge sind, die nie zuvor gebrochen haben. Die Forscher und Bibliothekare, die das vergangene Jahr damit verbracht haben, Spiegel zu bauen, sammeln nicht. Sie tun die unglückliche Wartung, die die Wissenschaft reproduzierbar macht. Hoffnung war nie ein Erhaltungsplan; Redundanz, es stellt sich heraus, ist tatsächlich.
Photo by Nisuda Nirmantha on Unsplash
