LIVEBSI-Grundschutz 2025: LLM-Sicherheit für Kritische Infrastrukturen·DeepSeek-V3: Open-Source-KI mit Multimodal-Reasoning für Unternehmen·KI-ROI in der Chemieindustrie 2025: Prozesse, Synthese, HaftungMittwoch, 30. September 2026

HELM 2025: So robust sind LLMs gegen Prompt Injection

HELM 2025 bewertet LLMs systematisch auf Sicherheitslücken wie Prompt Injection und Jailbreaks. Was Entscheider über aktuelle Benchmark-Ergebnisse wissen müssen.

ER
ecompanion Redaktion12.9.2026 · 3 Min. Lesezeit
↗ Teilen🔖 Merken🎧 Anhören
HELM 2025: So robust sind LLMs gegen Prompt Injection

Forschende von Mindgard und der Lancaster University haben in einer Studie (arXiv, 2025) sechs verbreitete LLM-Schutzsysteme getestet, darunter Microsofts Azure Prompt Shield und Metas Prompt Guard, und konnten diese mit zwei Angriffsmethoden in einzelnen Fällen zu 100 Prozent umgehen. Unternehmen, die KI-Anwendungen mit kommerziellen Guardrail-Lösungen absichern, können sich nicht allein auf diese Schutzmechanismen verlassen. Die Studie zeigt, dass sowohl zeichenbasierte Manipulationen als auch algorithmische Adversarial-Machine-Learning-Techniken ausreichen, um Erkennung zu umgehen und dennoch schadhaften Nutzen aus den Angriffen zu ziehen. Für Entscheider bedeutet das: Sicherheitsbewertungen von LLM-Systemen müssen aktive Red-Teaming-Tests einschließen, da passive Schutzsysteme allein keine verlässliche Absicherung gegen Prompt-Injection- und Jailbreak-Angriffe bieten.

LLM-Schutzsysteme unter Druck: Wie Angreifer Guardrails systematisch umgehen

Sicherheitsschichten für große Sprachmodelle lassen sich mit gezielten Angriffstechniken in einer Erfolgsrate von bis zu 100 Prozent überwinden. Das zeigt eine Studie von Forschern der Sicherheitsfirma Mindgard und der Lancaster University, die sechs verbreitete Schutzsysteme systematisch auf Schwachstellen getestet haben.

Hintergrund: Was Guardrails leisten sollen

Guardrail-Systeme sind Schutzschichten, die LLM-Anwendungen vor zwei zentralen Angriffsklassen absichern sollen: Prompt Injection, bei der externe Inhalte die Steuerung des Modells übernehmen, und Jailbreaks, bei denen Nutzer Sicherheitsfilter durch manipulierte Eingaben umgehen. Zu den in der Studie getesteten Systemen zählen Microsofts Azure Prompt Shield und Metas Prompt Guard, beides Produkte, die in Unternehmensumgebungen weit verbreitet sind.

Parallel dazu dokumentieren mehrere weitere Arbeiten die strukturellen Grenzen bestehender Bewertungsrahmen. Forscher um Piyush Jaiswal analysieren Inferenzzeit-Abwehrmethoden gegen Prompt Injection und Jailbreak-Angriffe (arXiv:2602.22242). Eine dritte Gruppe evaluiert LLM-Schwachstellen im Rahmen eines systematischen Red-Teaming-Ansatzes (arXiv:2505.04806).

Zwei Angriffswege, beide erfolgreich

Die Mindgard-Forscher William Hackett, Lewis Birch, Stefan Trawicki, Neeraj Suri und Peter Garraghan beschreiben zwei methodisch verschiedene Umgehungsstrategien:

Zeichenbasierte Injection: Durch gezielte Einfügung von Sonderzeichen oder nicht standardisierten Unicode-Zeichen können Erkennungsfilter ausgetrickst werden, ohne den inhaltlichen Kern der Angriffseingabe zu verändern.

Adversarial Machine Learning (AML): Algorithmengestützte Techniken aus dem Bereich des adversarialen maschinellen Lernens ermöglichen eine systematische Optimierung von Angriffseingaben. In einigen Szenarien erreichten die Forscher dabei eine vollständige Umgehung der Schutzmaßnahmen bei gleichzeitig erhaltenem Angriffspotenzial.

Ein zusätzlicher Befund der Studie: Angreifer können die Erfolgsrate gegen Black-Box-Ziele verbessern, indem sie die Wichtigkeit einzelner Wörter mithilfe von Offline-White-Box-Modellen berechnen und daraus optimierte Eingaben ableiten. Dieser Transferangriff senkt die Anforderungen an das Vorwissen über das Zielsystem erheblich.

Praktische Implikationen für Entscheider

1. Guardrails allein sind keine hinreichende Sicherheitsstrategie. Die Studie belegt, dass selbst kommerziell etablierte Schutzsysteme wie Azure Prompt Shield unter bestimmten Angriffsbedingungen vollständig versagen können. Unternehmen, die LLMs in kritischen Prozessen einsetzen, sollten Guardrail-Systeme als eine von mehreren Schutzschichten behandeln, nicht als alleinige Absicherung.

2. Angriffstransfer zwischen Modellen ist realistisch. Da Angreifer White-Box-Modelle nutzen können, um Angriffe zu entwickeln, die auf Black-Box-Zielsysteme übertragen werden, schützt mangelnde Transparenz über das eingesetzte Modell nur begrenzt. Sicherheitskonzepte müssen auch transferierbare Angriffsmuster berücksichtigen.

3. Benchmarking muss Sicherheitsdimensionen einschließen. Wer LLM-Anbieter anhand von Leistungsbenchmarks bewertet, sollte Robustheitstests gegenüber Prompt Injection und Jailbreaks explizit in die Evaluation einbeziehen. Standardbenchmarks wie HELM messen Robustheit zunehmend als eigenständige Dimension, wie ecompanion.ai bereits berichtet hat: HELM-Benchmark: Sicherheit, Effizienz und Bias bei LLMs und HELM 2024/2025: Sicherheit, Robustheit, Fairness.

4. Regulatorische Anforderungen steigen. Mit dem EU AI Act und den BSI-Richtlinien wächst der Druck auf Betreiber, eingesetzte Schutzmechanismen nicht nur zu dokumentieren, sondern auch deren Wirksamkeit nachzuweisen. Studien wie die vorliegende liefern methodische Grundlagen dafür, was unter einem belastbaren Test zu verstehen ist. Weitere Einordnung bieten die BSI-Richtlinien 2025 zur KI-Evaluierung und zum Monitoring von Foundation Models.

Einordnung: Wo die Forschung steht

Die Befunde reihen sich in eine breitere Debatte über die Verlässlichkeit von LLM-Benchmarks und Sicherheitsevaluierungen ein. Dass Benchmark-Ergebnisse unter realen Angriffsbedingungen nicht halten, was sie versprechen, ist kein Einzelfall, sondern ein strukturelles Problem der aktuellen Evaluierungslandschaft. Dazu passend: LLM-Benchmark-Manipulation und Validierung 2025 sowie die Methodikdiskussion bei lmarena vs. HELM: Evaluierungsmethoden im Vergleich.

Für Unternehmen, die Modelle wie Claude, GPT-4o oder Gemini in sensiblen Anwendungen einsetzen, bedeutet das: Die Wahl des Grundmodells allein entscheidet nicht über die Sicherheit des Systems. Architektur, Guardrails, Monitoring und regelmäßige Angriffssimulationen müssen zusammenwirken.

Quellen

Häufige Fragen

Was versteht man unter Guardrail-Systemen für LLMs und welchen Schutz sollen sie bieten?

Guardrail-Systeme sind Schutzmechanismen, die Large Language Models vor zwei zentralen Angriffsklassen absichern sollen: Prompt Injection und Jailbreaks. Bei Prompt Injection versuchen Angreifer, dem Modell über manipulierte Eingaben unerwünschte Anweisungen unterzuschieben. Jailbreaks zielen darauf ab, die eingebauten Sicherheitsrichtlinien des Modells zu umgehen. Zu den bekanntesten Guardrail-Lösungen zählen Microsofts Azure Prompt Shield und Metas Prompt Guard.

Wie erfolgreich können Angreifer bestehende Guardrail-Systeme umgehen?

Forscher von Mindgard und der Lancaster University haben in einer Studie (arXiv: 2504.11168) gezeigt, dass gängige Guardrail-Systeme erhebliche Schwachstellen aufweisen. Durch den Einsatz klassischer Zeicheninjektions-Methoden sowie algorithmischer Techniken aus dem Bereich Adversarial Machine Learning gelang es den Forschern, alle sechs getesteten Schutzsysteme zu umgehen. In einzelnen Szenarien wurde dabei eine Umgehungsrate von bis zu 100 Prozent erreicht, während die Angriffswirkung vollständig erhalten blieb.

Welche technischen Methoden nutzen Angreifer, um Erkennungssysteme zu täuschen?

Laut der Mindgard-Studie kommen zwei Hauptansätze zum Einsatz: Zum einen traditionelle Zeicheninjektions-Methoden, die die Eingabe auf Textebene verändern, ohne die inhaltliche Wirkung zu beeinträchtigen. Zum anderen algorithmische Evasion-Techniken aus dem Adversarial Machine Learning, bei denen etwa die Wortwichtigkeit mithilfe von White-Box-Modellen offline berechnet wird, um anschließend Black-Box-Schutzsysteme gezielter anzugreifen und deren Erkennungsrate zu senken.

Warum reichen aktuelle Sicherheitsbenchmarks möglicherweise nicht aus, um den Schutz von LLMs zuverlässig zu bewerten?

Bestehende Benchmarks testen Guardrail-Systeme häufig unter statischen Bedingungen und berücksichtigen adaptive Angreiferstrategien nur unzureichend. Die Forschungsergebnisse von Mindgard und Lancaster University zeigen, dass Angreifer durch den Einsatz von Offline-White-Box-Modellen ihre Angriffe dynamisch optimieren können, ohne direkten Zugang zum Zielsystem zu benötigen. Dieser Übertragungseffekt zwischen Modellen wird in vielen Standardbewertungen nicht abgebildet, was zu einer systematischen Überschätzung der tatsächlichen Schutzwirkung führen kann.

Was sollten Unternehmen aus diesen Erkenntnissen für ihre KI-Sicherheitsstrategie ableiten?

Unternehmen, die LLMs produktiv einsetzen, sollten sich nicht allein auf vorgelagerte Guardrail-Lösungen verlassen. Die Studienlage, unter anderem von Mindgard und der Lancaster University sowie weiterer Forschungsarbeiten (arXiv: 2602.22242), zeigt, dass selbst namhafte Schutzsysteme wie Azure Prompt Shield und Prompt Guard durch gezielte Evasion-Techniken ausgehebelt werden können. Empfohlen werden mehrschichtige Sicherheitsarchitekturen, regelmäßige Red-Teaming-Übungen sowie eine kontinuierliche Neubewertung eingesetzter Schutzmaßnahmen angesichts sich weiterentwickelnder Angriffsmethoden.


Dieser Artikel wurde von einem KI-System automatisiert erstellt. Kennzeichnung gemäß Art. 50 der EU-KI-Verordnung.

Quellen

  1. Bypassing Prompt Injection and Jailbreak Detection in LLM GuardrailsarXivPrimärquelleabgerufen 12. Sept. 2026
  2. Analysis of LLMs Against Prompt Injection and Jailbreak AttacksarXivPrimärquelleabgerufen 12. Sept. 2026
  3. Red Teaming the Mind of the Machine: A Systematic Evaluation of Prompt Injection and Jailbreak Vulnerabilities in LLMsarXivPrimärquelleabgerufen 12. Sept. 2026

Dieser Artikel wurde mit KI-Unterstützung erstellt und redaktionell geprüft.