LIVEBSI-Grundschutz 2025: LLM-Sicherheit für Kritische Infrastrukturen·DeepSeek-V3: Open-Source-KI mit Multimodal-Reasoning für Unternehmen·KI-ROI in der Chemieindustrie 2025: Prozesse, Synthese, HaftungMittwoch, 30. September 2026

NIST Privacy Engineering: Datenschutz-by-Design für LLM-RAG-Systeme

Wie NIST Privacy Engineering und DSGVO 2025 den Aufbau sicherer LLM-basierter RAG-Systeme und die Trainingsdatenverwaltung in Unternehmen konkret vorgeben.

ER
ecompanion Redaktion13.9.2026 · 4 Min. Lesezeit
↗ Teilen🔖 Merken🎧 Anhören
NIST Privacy Engineering: Datenschutz-by-Design für LLM-RAG-Systeme

Viele LLM-basierte Systeme setzen auf Cloud-Dienste und erzeugen damit Datenschutzrisiken. Eine im Februar 2025 auf arXiv veröffentlichte Studie präsentiert eine geschlossene Open-Source-Referenzarchitektur, die DSGVO-konforme RAG-Systeme ohne externe Cloud-Abhängigkeit ermöglicht. Unternehmen, die LLMs produktiv einsetzen, stehen vor der Pflicht, personenbezogene Daten sicher zu verwalten. Die vorgestellte Architektur adressiert konkret die vier Kernhürden: Rechenkapazitäten, Datenverwaltung, Skalierbarkeit und Sicherheitsrisiken. Eine integrierte Evaluationspipeline erlaubt zudem die systematische Überprüfung von Leistung und Compliance, was für Entscheider in regulierten Branchen ein zentrales Auswahlkriterium darstellt.

NIST Privacy Engineering und DSGVO 2025: Datenschutz-by-Design für LLM-basierte RAG-Systeme

Viele LLM-basierte Lösungen werden als offene Systeme betrieben, die auf Cloud-Dienste angewiesen sind und damit Risiken für die Vertraulichkeit und Sicherheit sensibler Unternehmensdaten erzeugen. Eine im Februar 2025 veröffentlichte Referenzarchitektur zeigt, wie Organisationen dem mit geschlossenen, auf Open-Source-Technologien basierenden Systemen begegnen können.

Ausgangslage: Warum offene LLM-Systeme unter Druck stehen

Retrieval-Augmented-Generation-Systeme (RAG) verknüpfen Sprachmodelle mit unternehmensinternen Wissensdatenbanken. Sobald dabei personenbezogene Daten verarbeitet werden, greifen die Anforderungen der DSGVO sowie internationale Rahmwerke wie das NIST Privacy Engineering Framework. Der Konflikt liegt in der Architektur: Cloudbasierte LLM-Dienste erfordern, dass Anfragen und Kontext an externe Server übermittelt werden. Für Organisationen, die mit Gesundheitsdaten, Finanzdaten oder anderen schutzwürdigen Informationen arbeiten, ist dieses Modell regulatorisch problematisch.

Die im Februar 2025 auf arXiv veröffentlichte Forschungsarbeit “Datenschutzkonformer LLM-Einsatz: Eine Open-Source-Referenzarchitektur” analysiert genau diesen Zielkonflikt und präsentiert einen strukturierten Lösungsansatz.

Die Referenzarchitektur: Geschlossene Systeme mit Open-Source-Technologien

Laut der Publikation benötigen Organisationen geschlossene LLM-Systeme, die Datenschutzvorgaben einhalten und gleichzeitig eine hohe Leistungsfähigkeit gewährleisten. Die vorgestellte Architektur setzt vollständig auf Open-Source-Komponenten und erfüllt damit zwei zentrale Anforderungen gleichzeitig: Transparenz über die eingesetzten Technologien und vollständige Datensouveränität durch On-Premise- oder Private-Cloud-Betrieb.

Die Autoren identifizieren vier zentrale Herausforderungen bei der Implementierung solcher Systeme:

Ergänzt wird die Architektur durch eine Evaluationspipeline, die eine systematische Bewertung der Systemleistung und Compliance ermöglicht. Damit lässt sich die Einhaltung datenschutzrechtlicher Vorgaben nicht nur konzeptionell behaupten, sondern mess- und dokumentierbar machen.

Praktische Implikationen für Entscheider

1. Datenschutz-by-Design beginnt bei der Architekturwahl

Unternehmen, die RAG-Systeme für sensible Anwendungsfälle planen, sollten frühzeitig entscheiden, ob ein cloudbasiertes oder ein geschlossenes System zum Einsatz kommt. Die nachträgliche Umrüstung eines cloud-nativen Systems auf datenschutzkonforme Betriebsweise ist aufwendiger als der initiale Entwurf als geschlossenes System. NIST Privacy Engineering empfiehlt explizit, Datenschutzanforderungen als Systemanforderungen zu behandeln, nicht als nachgelagerte Compliance-Aufgabe. Mehr zu Governance-Anforderungen finden Sie im Überblick zum NIST AI Risk Management Framework.

2. Trainingsdatenverwaltung erfordert eigene Prozesse

Die DSGVO-konforme Verwaltung von Trainingsdaten umfasst mehr als die Einholung von Einwilligungen. Organisationen müssen nachweisen können, welche Daten zu welchem Zeitpunkt in welches Modell eingeflossen sind, und im Fall von Löschanfragen (Recht auf Vergessenwerden) auf diese Daten gezielt einwirken können. Für RAG-Systeme bedeutet das: Die Retrieval-Datenbank muss granular verwaltbar sein, sodass einzelne Dokumente entfernt und die Auswirkung dieser Entfernung auf Systemantworten verifiziert werden kann. Einen vertieften Blick auf die EDPB-Leitlinien zu diesem Thema bietet der Artikel zu LLM-Trainingsdaten und DSGVO.

3. Evaluationspipelines als Compliance-Nachweis

Die im Februar 2025 vorgestellte Architektur betont eine systematische Evaluationspipeline ausdrücklich als Bestandteil der datenschutzkonformen Lösung. Für Unternehmen mit DSGVO-Rechenschaftspflicht (Art. 5 Abs. 2 DSGVO) ist das relevant: Aufsichtsbehörden erwarten nicht nur die Einhaltung von Anforderungen, sondern deren dokumentierten Nachweis. Automatisierte Evaluationen, die Datenlecks, unerwünschte Ausgaben oder Compliance-Verstöße messen, sind damit kein optionaler Qualitätsbaustein, sondern Teil der Pflichtdokumentation. Ergänzend dazu sind die BSI-Richtlinien zur sicheren KI-Evaluierung zu berücksichtigen.

4. Open-Source als strategische Datenschutzoption

Proprietäre Modelle großer Anbieter bieten heute umfangreiche Funktionen, aber eingeschränkte Transparenz über interne Verarbeitungsprozesse. Open-Source-Modelle, die lokal betrieben werden, erlauben eine vollständige Nachvollziehbarkeit der Datenverarbeitung und erleichtern Audits. Für Branchen mit erhöhten Schutzanforderungen wie Gesundheitswesen, Finanzdienstleistungen oder öffentliche Verwaltung kann das ein entscheidendes Kriterium sein. Einen Überblick zu kleinen Modellen für den On-Premise-Betrieb bietet der Artikel zu kleinen Modellen für lokale Infrastruktur.

Einordnung: Regulatorischer Druck steigt 2025

Die Publikation erscheint in einem regulatorischen Umfeld, das sich 2025 weiter verdichtet. Der EU AI Act tritt in wesentlichen Teilen in Kraft, die EDPB hat Leitlinien zu generativer KI veröffentlicht, und das BSI hat Anforderungen an sichere KI-Systeme konkretisiert. Organisationen, die LLM-basierte Systeme mit personenbezogenen Daten betreiben, stehen damit vor einer klaren Anforderungslage: Datenschutz ist keine Frage des guten Willens, sondern eine nachweispflichtige Systemeigenschaft.

Die Open-Source-Referenzarchitektur aus der Februar-2025-Publikation liefert dafür eine strukturierte Grundlage, auch wenn jede Organisation die konkrete Implementierung an ihre spezifischen technischen und regulatorischen Bedingungen anpassen muss. Weitere Informationen zu DSGVO-Anforderungen für LLM-Auftragsverarbeitung sowie zur NIST Privacy Engineering-Anwendung für LLM-Systeme in der EU ergänzen den Überblick.

Quellen

Häufige Fragen

Warum reichen cloud-basierte LLM-Lösungen für datenschutzkonforme RAG-Systeme oft nicht aus?

Viele LLM-basierte Systeme sind als offene Systeme konzipiert und auf externe Cloud-Dienste angewiesen. Das bringt konkrete Risiken für die Vertraulichkeit und Sicherheit der verarbeiteten Daten mit sich. Sobald personenbezogene oder geschäftskritische Daten an externe Dienste übertragen werden, verlieren Organisationen die Kontrolle über deren Verarbeitung. Für DSGVO-konforme Anwendungen ist dies in vielen Szenarien nicht akzeptabel.

Was versteht man unter einem geschlossenen LLM-System im Sinne der Datenschutz-by-Design-Anforderungen?

Ein geschlossenes LLM-System hält Datenverarbeitung und Modellbetrieb innerhalb einer kontrollierten Infrastruktur. Es ist so gestaltet, dass keine Daten an externe Drittanbieter übermittelt werden. Laut einer im Februar 2025 auf arXiv veröffentlichten Referenzarchitektur (arxiv.org/html/2503.01915) müssen solche Systeme gleichzeitig Datenschutzvorgaben erfüllen und eine hohe Leistungsfähigkeit gewährleisten. Open-Source-Technologien spielen dabei eine zentrale Rolle, da sie Transparenz und Anpassbarkeit ermöglichen.

Welche zentralen technischen Herausforderungen entstehen bei der Implementierung datenschutzkonformer LLM-Architekturen?

Die im Februar 2025 vorgestellte Open-Source-Referenzarchitektur benennt vier Kernherausforderungen: ausreichende Rechenkapazitäten für den Betrieb leistungsfähiger Modelle ohne Cloud-Abhängigkeit, sichere und strukturierte Datenverwaltung, Skalierbarkeit der gesamten Infrastruktur sowie die Beherrschung von Sicherheitsrisiken. Besonders die Kombination aus Skalierbarkeit und Datenisolation stellt Organisationen vor erhebliche Anforderungen an die eigene IT-Infrastruktur.

Wie lässt sich die Compliance eines geschlossenen LLM-Systems systematisch nachweisen?

Die im Februar 2025 veröffentlichte Referenzarchitektur sieht dafür eine dedizierte Evaluationspipeline vor. Diese ermöglicht eine systematische Bewertung sowohl der Systemleistung als auch der Compliance-Anforderungen. Ein solcher Ansatz ist wichtig, weil Datenschutzkonformität nicht nur bei der Inbetriebnahme, sondern kontinuierlich im laufenden Betrieb nachgewiesen werden muss. Das entspricht dem Rechenschaftsprinzip der DSGVO, das eine dokumentierbare Nachweisbarkeit von Schutzmaßnahmen verlangt.

Welche Vorteile bieten Open-Source-Technologien speziell für datenschutzkonforme RAG-Systeme gegenüber proprietären Lösungen?

Open-Source-Technologien bieten laut der arXiv-Referenzarchitektur vom Februar 2025 zwei entscheidende Eigenschaften: Flexibilität und Transparenz. Flexibilität erlaubt es, die Architektur an organisationsspezifische Datenschutz- und Sicherheitsanforderungen anzupassen. Transparenz ermöglicht es, den Quellcode zu prüfen und damit nachzuweisen, dass keine unerwünschten Datentransfers stattfinden. Beides sind Voraussetzungen, um die Anforderungen an Datenschutz-by-Design nach Artikel 25 DSGVO glaubhaft umzusetzen.


Dieser Artikel wurde von einem KI-System automatisiert erstellt. Kennzeichnung gemäß Art. 50 der EU-KI-Verordnung.

Quellen

  1. Datenschutzkonformer LLM-Einsatz: Eine Open-Source-ReferenzarchitekturarXivPrimärquelleabgerufen 13. Sept. 2026
  2. Datenschatz für KI nutzen, Datenschutz mit KI wahrenPlattform Lernende SystemePrimärquelleabgerufen 13. Sept. 2026

Dieser Artikel wurde mit KI-Unterstützung erstellt und redaktionell geprüft.