Laut einer Newsguard-Analyse wiederholten führende KI-Chatbots wie ChatGPT, Copilot und Grok in 33 Prozent der Testfälle Inhalte aus russischen Falschmeldungen, weil kompromittierte Echtdaten in ihre Trainingspipelines gelangt waren. Für Unternehmen, die LLMs im produktiven Betrieb einsetzen, verdeutlicht dieser Befund ein zentrales Compliance-Risiko: Echte Webdaten sind schwer auf DSGVO-Konformität und inhaltliche Integrität prüfbar. Synthetische Trainingsdaten, wie sie etwa das Fraunhofer IPM entwickelt, erlauben hingegen eine kontrollierte Datenerzeugung ohne personenbezogene Rohdaten und reduzieren gleichzeitig Annotationskosten. Entscheider sollten 2025 den Datenmix ihrer KI-Systeme kritisch bewerten.
LLM-Trainingsdaten 2025: Was DSGVO-Konformität bei synthetischen und echten Daten bedeutet
Wer große Sprachmodelle in Europa trainiert oder einsetzen möchte, steht vor einer zentralen Weichenstellung: Echte Nutzerdaten bieten Realitätsnähe, ziehen aber erhebliche datenschutzrechtliche Pflichten nach sich. Synthetische Trainingsdaten versprechen Kosteneffizienz und regulatorische Planbarkeit, erfordern aber ihrerseits eine sorgfältige technische und rechtliche Ausgestaltung.
Leitfakt: Qualität der Trainingsdaten bestimmt KI-Leistung und Compliance-Risiko
Das Fraunhofer IPM beschreibt Trainingsdaten als den wesentlichen Einflussfaktor für die Leistungsfähigkeit einer KI und gleichzeitig als Hauptkostentreiber. Sowohl die Auswahl geeigneter Rohdaten als auch deren manuelle Annotation sind demnach sehr zeitintensiv. Parallel dazu zeigen Analysen aus dem Heise-Forum, dass ohne Kenntnis der Trainingsdaten grundlegende Qualitätseigenschaften eines LLM-Systems von außen nicht prüfbar sind. Und eine Studie des Unternehmens Newsguard belegt, dass gezielt platzierte Falschinformationen aus dem prorussischen Netzwerk “Pravda” in 33 Prozent der getesteten Fälle von ChatGPT, Copilot, Grok und weiteren Chatbots reproduziert wurden. Die Herkunft und Integrität von Trainingsdaten ist damit nicht nur ein Kostenthema, sondern ein Sicherheits- und Haftungsthema.
Praktische Implikationen für Unternehmen
1. Echte Daten: DSGVO-Pflichten greifen vollumfänglich
Wer personenbezogene Daten zum Training von Sprachmodellen verwendet, bewegt sich im Anwendungsbereich der DSGVO. Rechtsgrundlage, Zweckbindung, Betroffenenrechte und Löschpflichten müssen lückenlos dokumentiert sein. Das gilt auch dann, wenn die Daten ursprünglich zu einem anderen Zweck erhoben wurden. Unternehmen, die LLMs auf internen Kunden- oder Mitarbeiterdaten feinabstimmen wollen, sollten die Anforderungen an Auftragsverarbeitung und Drittlandtransfers frühzeitig prüfen. Weiterführende Einordnung bietet der Artikel DSGVO und LLMs: Auftragsverarbeitung im Überblick.
2. Synthetische Daten: Kein Freifahrtschein, aber strukturierter Vorteil
Synthetische Trainingsdaten entstehen durch parametrische Generierung aus bekannten Modellen und können für viele Anwendungsfälle ohne weitere Annotation direkt eingesetzt werden, wie das Fraunhofer IPM beschreibt. Der datenschutzrechtliche Vorteil liegt auf der Hand: Wenn keine personenbezogenen Daten im Rohdatensatz enthalten sind, entfällt der DSGVO-Pflichtenkatalog weitgehend. Allerdings setzt das voraus, dass die synthetischen Daten tatsächlich anonym sind und keine Rückschlüsse auf natürliche Personen zulassen. Eine ungeprüfte Annahme, alle synthetischen Daten seien per Definition DSGVO-neutral, ist rechtlich nicht haltbar. Hinweise zur regulatorischen Einstufung finden sich auch bei EDPB-Leitlinien zu synthetischen Trainingsdaten und Anonymisierung.
3. Datenvergiftung als unterschätztes Unternehmensrisiko
Die Newsguard-Studie zeigt, dass Trainingsdaten nicht nur passiv Qualitätsprobleme erzeugen, sondern aktiv als Angriffsfläche genutzt werden können. Das prorussische Netzwerk “Pravda” betreibt laut der Analyse gezielt 150 kremlnahe Websites, um möglichst viel russlandfreundliche Falschinformation in die Trainingsdaten von KI-Modellen zu schleusen und die Echtzeit-Suche zu beeinflussen. Für Unternehmen, die externe Datenquellen in ihre Modelle oder RAG-Systeme einspeisen, bedeutet das: Die Qualitätssicherung der Eingangsdaten muss technische Verifizierungsprozesse umfassen, nicht nur vertragliche Zusicherungen. Wer synthetische Daten einsetzt, sollte sicherstellen, dass diese nicht aus kontaminierten Quellen generiert wurden. Hintergründe zu Datenkontamination und Benchmarkintegrität bietet Synthetic Data Contamination und LLM-Benchmarks.
4. EU AI Act und EDPB-Leitlinien verschärfen den Rahmen ab 2025
Die datenschutzrechtliche Einordnung von LLM-Trainingsdaten wird durch zwei parallele Regulierungsstränge komplexer. Der EU AI Act stellt für GPAI-Modelle Transparenz- und Dokumentationspflichten auf, die auch Trainingsdaten betreffen. Der Europäische Datenschutzausschuss (EDPB) hat zudem Leitlinien erarbeitet, die explizit auf die Verarbeitung personenbezogener Daten beim Training generativer KI-Modelle eingehen. Beide Regelwerke verlangen von Unternehmen nachvollziehbare Dokumentation darüber, welche Daten zu welchem Zweck in ein Modell eingeflossen sind. Synthetische Daten können hier einen Vorteil bieten, sofern die Generierungspipeline selbst dokumentiert und nachvollziehbar ist. Einen Überblick zum regulatorischen Rahmen liefern EDPB-Leitlinien 2025 zu Transparenz und LLM-Training sowie EU AI Act: Compliance-Anforderungen für KI-Anbieter.
Fazit
Synthetische Trainingsdaten bieten 2025 einen strukturellen Vorteil im Hinblick auf DSGVO-Konformität und Kostenkontrolle, ersetzen aber keine sorgfältige rechtliche und technische Prüfung. Echte Daten bleiben für viele Anwendungsfälle unverzichtbar, müssen aber konsequent auf Rechtsgrundlage, Zweckbindung und Datenqualität geprüft werden. Die Gefahr gezielter Datenvergiftung macht in beiden Szenarien robuste Qualitätssicherungsprozesse zur Pflicht.
Quellen
- Trainingsdaten vergiften: Russische Propaganda für KI-Modelle (heise online)
- Trainingsdaten | Forum heise online: KI kann lügen und betrügen
- Synthetische Trainingsdaten – Fraunhofer IPM
Häufige Fragen
Warum sind echte Trainingsdaten aus datenschutzrechtlicher Sicht problematisch?
Echte Trainingsdaten enthalten häufig personenbezogene Informationen aus öffentlich zugänglichen Quellen. Die Auswahl geeigneter Rohdaten und deren manuelle Annotation sind sehr zeitintensiv und damit kostspielig. Gleichzeitig besteht das Risiko, dass dabei Daten verarbeitet werden, die ohne ausreichende Rechtsgrundlage im Sinne der DSGVO erhoben wurden. Wer die Herkunft der Trainingsdaten nicht lückenlos dokumentieren kann, hat im Fall einer Prüfung durch Aufsichtsbehörden kaum Möglichkeiten, die Rechtmäßigkeit der Verarbeitung nachzuweisen.
Was sind synthetische Trainingsdaten und welche Vorteile bieten sie?
Synthetische Trainingsdaten werden nicht aus realen Messungen oder Nutzerinteraktionen gewonnen, sondern künstlich erzeugt, etwa durch parametrische Simulation von Messszenarien auf Basis dreidimensionaler Modelle. Das Fraunhofer IPM entwickelt entsprechende Software, die automatisch synthetische Daten aus solchen Modellen generiert. Da die simulierten Szenen aus bekannten, klassifizierten Modellen bestehen, lassen sich Annotationen direkt übertragen, ohne zusätzlichen manuellen Aufwand. Das reduziert sowohl Kosten als auch die Verarbeitungsmenge personenbezogener Daten erheblich.
Sind synthetische Trainingsdaten automatisch DSGVO-konform?
Nicht zwingend. Synthetische Daten, die keinerlei Bezug zu identifizierbaren natürlichen Personen aufweisen, fallen grundsätzlich nicht unter den Anwendungsbereich der DSGVO. Entscheidend ist jedoch, ob bei der Erzeugung der synthetischen Daten reale personenbezogene Ausgangsdaten verwendet wurden. Ist das der Fall, greift die DSGVO bereits im Erzeugungsprozess. Unternehmen müssen den gesamten Datenpfad vom Ursprung bis zum fertigen Trainingsdatensatz prüfen und dokumentieren.
Welche konkreten Risiken entstehen, wenn KI-Modelle mit unkontrollierten Echtdaten aus dem Web trainiert werden?
Neben datenschutzrechtlichen Risiken drohen inhaltliche Qualitätsprobleme. Eine Analyse des Unternehmens Newsguard ergab, dass ChatGPT, Copilot, Grok und weitere Chatbots in 33 Prozent der getesteten Fälle Inhalte aus Falschmeldungen wiedergaben. Hintergrund ist das prorussische Desinformationsnetzwerk “Pravda”, das mit rund 150 Kreml-nahen Websites gezielt darauf abzielt, russlandfreundliche Falschinformationen in die Trainingsdaten von KI-Modellen einzuschleusen. Unkontrollierte Webdaten können also sowohl zu DSGVO-Verstößen als auch zu sachlich falschen Modellantworten führen.
Wie können Unternehmen die Qualität und Herkunft ihrer Trainingsdaten überprüfen?
Fachleute empfehlen, Trainingsdaten systematisch zu sichten und unterschiedliche Eingaben mit den erzeugten Ausgaben abzugleichen. Dabei sollte geprüft werden, ob Ausgaben des Modells auf konkrete Quellen im Trainingsmaterial zurückführbar sind. Für wissenschaftliche Behauptungen über Modellfähigkeiten gilt: Die zugrundeliegenden Fachpublikationen sollten im Original gelesen und der Stand des Peer-Review-Prozesses bewertet werden. Nur so lässt sich beurteilen, ob behauptete Modelleigenschaften tatsächlich belegt sind oder lediglich auf unkontrollierten Trainingsdaten beruhen.
Dieser Artikel wurde von einem KI-System automatisiert erstellt. Kennzeichnung gemäß Art. 50 der EU-KI-Verordnung.




