Der Europäische Datenschutzausschuss (EDPB) stellt klar: Pseudonymisierte Trainingsdaten für generative KI-Modelle gelten weiterhin als personenbezogene Daten und unterliegen vollumfänglich der DSGVO, da eine Re-Identifizierung nicht ausgeschlossen werden kann. Unternehmen, die generative KI-Modelle mit pseudonymisierten Datensätzen trainieren, genießen keinen automatischen DSGVO-Schutzstatus. Erst eine vollständige Anonymisierung, bei der eine Person auf keine vernünftigerweise wahrscheinliche Weise identifizierbar bleibt, entbindet von den Pflichten der DSGVO. Für Entscheider bedeutet das: Jede KI-Trainingspipeline muss datenschutzrechtlich geprüft werden, bevor Produktionsdaten eingesetzt werden.
EDPB-Prüfverfahren bei Gen-AI-Trainingsdaten: Was Anonymisierung, synthetische Daten und DSGVO-Compliance 2025 für Unternehmen bedeuten
Der Europäische Datenschutzausschuss (EDPB) unterscheidet beim Einsatz von Trainingsdaten für generative KI-Systeme klar zwischen zwei Kategorien: pseudonymisierten Daten, die weiterhin der DSGVO unterliegen, und tatsächlich anonymisierten Daten, für die die DSGVO nach korrekter Umsetzung nicht mehr gilt. Diese Unterscheidung hat unmittelbare praktische Konsequenzen für Unternehmen, die Sprachmodelle entwickeln oder einsetzen.
Was der EDPB konkret verlangt
Laut EDPB gilt Pseudonymisierung als Verfahren, bei dem personenbezogene Daten so umgewandelt werden, dass sie ohne zusätzliche Informationen keiner bestimmten Person mehr zugeordnet werden können. Voraussetzung ist, dass diese Zusatzinformationen getrennt aufbewahrt und durch technische und organisatorische Maßnahmen abgesichert werden. In der Praxis bedeutet das: Namen, Telefonnummern oder persönliche Nummern werden durch Aliase oder fortlaufende Nummern ersetzt. Pseudonymisierte Daten sind jedoch nach wie vor personenbezogene Daten und unterliegen vollständig der DSGVO.
Anonymisierte Daten hingegen sind solche, bei denen eine Identifizierung der betroffenen Person mit keiner vernünftigerweise wahrscheinlichen Methode mehr möglich ist. Erst dann entfällt die Anwendbarkeit der DSGVO. Die Anforderung ist hoch: Die Anonymisierung muss so robust sein, dass keine realistische Möglichkeit der Reidentifizierung besteht.
Der Branchenverband Bitkom hat in einem Leitfaden zu Anonymisierung und Pseudonymisierung dargelegt, dass Unternehmen häufig den Unterschied zwischen beiden Verfahren unterschätzen und Pseudonymisierungen fälschlicherweise als vollständige Anonymisierung behandeln. Dies ist aus Compliance-Sicht ein zentrales Risiko.
Praktische Implikationen für Unternehmen
1. Trainingsdaten-Auswahl erfordert juristische Prüfung
Wer Sprachmodelle mit internen Unternehmensdaten trainiert oder fine-tuned, muss vorab prüfen, ob die verwendeten Datensätze tatsächlich anonymisiert sind. Pseudonymisierte Bestände lösen DSGVO-Pflichten aus: Rechtsgrundlage, Zweckbindung, Betroffenenrechte. Eine pauschale Annahme, dass interne Datenaufbereitungen ausreichen, ist rechtlich nicht haltbar. Mehr zu den Anforderungen an die LLM-Datenverarbeitung lesen Sie unter EDPB-Leitlinien 2025: Transparenz, LLM-Training und DSGVO.
2. Synthetische Daten sind kein automatischer Freifahrtschein
Synthetische Trainingsdaten gelten als vielversprechender Ansatz, um DSGVO-Risiken zu reduzieren. Entscheidend ist jedoch, wie sie generiert wurden: Werden sie aus pseudonymisierten Ausgangsdaten abgeleitet, können sie unter Umständen noch immer Rückschlüsse auf Einzelpersonen ermöglichen. Der EDPB bewertet die Schutzwirkung anhand der tatsächlichen Reidentifizierbarkeit, nicht anhand des Verfahrensnamens. Details zur DSGVO-Konformität synthetischer Trainingsdaten finden Sie unter Synthetische Trainingsdaten, Anonymisierung und DSGVO-LLM-Compliance und LLM-Training mit synthetischen Daten: DSGVO-Konformität.
3. Auftragsverarbeitung bleibt relevant
Auch wenn ein Unternehmen Modelltraining an externe Dienstleister auslagert, bleibt es für die datenschutzkonforme Grundlage der Trainingsdaten verantwortlich. Auftragsverarbeitungsverträge (AVV) decken nicht die Frage ab, ob die Daten überhaupt verarbeitet werden dürfen. Diese Verantwortung liegt beim Verantwortlichen. Eine vertiefte Einordnung zur Auftragsverarbeitung bei LLMs bietet der Artikel DSGVO und LLMs: Auftragsverarbeitung im Überblick.
4. Datenschutz-by-Design als Entwicklungsanforderung
Für Unternehmen, die eigene KI-Produkte entwickeln, bedeuten die EDPB-Positionen, dass Datenschutzaspekte bereits in der Systemarchitektur verankert sein müssen. Nachträgliche Anonymisierungsversuche sind technisch fehleranfällig und regulatorisch schwerer zu belegen. Einen Überblick zum Ansatz Privacy by Design für LLM-Systeme liefert NIST Privacy Engineering: Datenschutz by Design für LLM-Systeme.
Einordnung
Die EDPB-Positionen sind keine Neuigkeit, gewinnen aber im Kontext der wachsenden Verbreitung generativer KI-Systeme an praktischer Schärfe. Unternehmen, die bislang auf vereinfachte Datenvorbereitung gesetzt haben, müssen ihre Prozesse anhand der tatsächlichen Anonymisierungsstandards überprüfen. Die Unterscheidung zwischen Pseudonymisierung und echter Anonymisierung ist dabei nicht nur eine Frage der Terminologie, sondern bestimmt unmittelbar den regulatorischen Rahmen, unter dem ein KI-Vorhaben operiert. Weiterführende Informationen zu den EDPB-Leitlinien für generative KI bietet EDPB Guidelines 2025: Datenschutz, LLM und Generative AI in der EU.
Quellen
- Was ist der Unterschied zwischen pseudonymisierten und anonymisierten Daten? | European Data Protection Board
- Anonymisierung und Pseudonymisierung von Daten | Bitkom (PDF)
Häufige Fragen
Was unterscheidet anonymisierte von pseudonymisierten Trainingsdaten für KI-Modelle rechtlich?
Pseudonymisierte Daten ersetzen direkte Identifikatoren wie Namen oder Telefonnummern durch Aliase oder Nummern, bleiben aber personenbezogen und unterliegen weiterhin der DSGVO. Anonymisierte Daten sind so aufbereitet, dass eine Identifizierung mit vernünftigerweise einsetzbaren Mitteln ausgeschlossen ist. Erst dann entfällt die DSGVO-Anwendbarkeit. Für KI-Training ist diese Unterscheidung zentral.
Wann gilt ein Datensatz für das KI-Training laut EDPB als wirksam anonymisiert?
Der European Data Protection Board stellt klar, dass Daten nur dann als anonymisiert gelten, wenn eine betroffene Person auf keine Weise mehr identifizierbar ist, die vernünftigerweise wahrscheinlich angewendet wird. Eine bloße Entfernung von Namen genügt nicht. Unternehmen müssen technische und organisatorische Maßnahmen nachweisen, die eine Re-Identifizierung mit realistisch verfügbaren Mitteln ausschließen.
Sind synthetische Daten automatisch DSGVO-frei und für Gen-AI-Training unbedenklich?
Nein, nicht automatisch. Synthetische Daten gelten nur dann als außerhalb des DSGVO-Anwendungsbereichs, wenn sie keine Rückschlüsse auf reale Personen zulassen. Werden sie aus personenbezogenen Ursprungsdaten erzeugt, müssen die Generierungsschritte selbst DSGVO-konform sein. Ob das Ergebnis wirklich anonym ist, hängt vom konkreten Verfahren und dem verbleibenden Re-Identifikationsrisiko ab.
Welche Maßnahmen empfiehlt der EDPB, damit pseudonymisierte Daten nicht unbefugt re-identifiziert werden?
Der EDPB verlangt, dass Zusatzinformationen, die eine Re-Identifizierung ermöglichen, getrennt von den pseudonymisierten Daten aufbewahrt werden. Zudem müssen technische und organisatorische Maßnahmen sicherstellen, dass keine Zusammenführung ohne Berechtigung erfolgt. Für KI-Trainingspipelines bedeutet das klare Zugriffskontrollen und dokumentierte Datentrennung zwischen Trainings- und Zuordnungsdaten.
Was müssen Unternehmen 2025 konkret beachten, wenn sie personenbezogene Daten zur KI-Entwicklung anonymisieren?
Unternehmen müssen nachweisen, dass ihr Anonymisierungsverfahren einer Re-Identifizierung standhält, auch unter Berücksichtigung externer Datenquellen. Bitkom und EDPB betonen, dass Anonymisierung keine einmalige Maßnahme ist, sondern laufend überprüft werden muss. Insbesondere bei großen Sprachmodellen, die Trainingsdaten faktisch speichern können, bleibt die Frage der wirksamen Anonymisierung eine zentrale Compliance-Anforderung.
Dieser Artikel wurde von einem KI-System automatisiert erstellt. Kennzeichnung gemäß Art. 50 der EU-KI-Verordnung.




