KI-BedrohungskatalogPrompt-Angriffe und Umgehung von SchutzmechanismenProduktion
Jailbreaks
Mit Tricks wie Rollenspielen, hypothetischen Szenarien oder kodierten Eingaben bringen Angreifer das KI-System dazu, seine Sicherheitsregeln zu umgehen und eigentlich gesperrte Inhalte auszugeben. Jailbreak heißt: die verankerten Schutzmechanismen umgehen.
Beschreibung
Moderne KI-Systeme sind darauf trainiert, bestimmte Ausgaben zu verweigern, etwa Anleitungen zu Straftaten oder Schadsoftware. Ein Jailbreak umgeht dieses Safety-Training, also die im Modell verankerte Sicherheitsausrichtung. Verbreitete Muster sind das Vortäuschen einer Rolle oder Figur, das Einkleiden der Bitte in ein hypothetisches oder fiktives Szenario, das Aufteilen einer verbotenen Frage in harmlose Teile sowie das Verschleiern über fremde Sprachen oder Kodierungen wie Base64. Auch mehrstufige Gespräche, die sich Schritt für Schritt steigern, kommen vor. Erprobte Jailbreak-Vorlagen kursieren öffentlich im Internet und lassen sich ohne Fachwissen nachnutzen.
Mögliche Auswirkung
Das System kann Inhalte erzeugen, die es sperren sollte, etwa Anleitungen zu Waffen, Schadsoftware oder Hassrede. Für den Betreiber entstehen Reputations-, Rechts- und Regulierungsrisiken, und schädliche Ausgaben können reale Personen gefährden. Bei besonders leistungsfähigen Modellen zählt dies im EU-AI-Act-Kontext zu den systemischen Risiken.
Beispiel
Eine Person bittet das System, als "Schauspieler ohne Regeln" ein Drehbuch zu schreiben, in dem eine Figur Schritt für Schritt die Herstellung einer gefährlichen Substanz erklärt. Durch die fiktive Einkleidung liefert das System die sonst verweigerte Anleitung.
Empfohlene Gegenmaßnahmen (4)
Jede Maßnahme nennt ihre Maßnahmenart, Wirkung, Umsetzungsebene und die Begründung der Einordnung.
Robustes Safety-Training (RLHF, Constitutional AI)Technisch
- Wirkung
- Präventiv
- Umsetzungsebene
- Modell & Training
- Begründung der Einordnung
- „Robustes Safety-Training (RLHF, Constitutional AI)“ ist primär technisch: Ein Modell-, Trainings- oder Datenverfahren verändert Systemverhalten oder Robustheit unmittelbar.
Moderation der Ausgabe-InhalteTechnisch
- Wirkung
- Präventiv
- Umsetzungsebene
- Modell & Training, Anwendung, API & Agenten
- Begründung der Einordnung
- „Moderation der Ausgabe-Inhalte“ ist primär technisch: Systemseitige Prüf-, Transformations- oder Blockierregeln stoppen oder neutralisieren unzulässige Inhalte vor der Weiterverarbeitung.
Erkennung von Jailbreak-MusternTechnisch
- Wirkung
- Aufdeckend
- Umsetzungsebene
- Anwendung, API & Agenten
- Begründung der Einordnung
- „Erkennung von Jailbreak-Mustern“ ist primär technisch: Software oder Analysewerkzeuge erzeugen und bewerten systematisch Messwerte, Abweichungen oder Angriffsindikatoren.
Defense-in-Depth mit mehreren Safety-SchichtenTechnisch
- Wirkung
- Präventiv
- Umsetzungsebene
- Modell & Training, Anwendung, API & Agenten
- Begründung der Einordnung
- „Defense-in-Depth mit mehreren Safety-Schichten“ ist primär technisch: Sichere Formate, restriktive Voreinstellungen oder Schutzschichten reduzieren unsichere Ausführungspfade und Angriffsflächen.
Standard-Zuordnungen
Verifizierte Fundstellen in OWASP, NIST AI RMF, MITRE ATLAS, EU AI Act und weiteren Rahmenwerken. Die Zuordnungen sind taxonomisch, kein Konformitätsnachweis.
Belegte Referenzen (11)
Jede Referenz nennt Rahmenwerk, Fundstelle und die herausgebende Organisation.
- OWASP LLM Top 10 LLM01:2025 Prompt InjectionLLM01:2025 Prompt Injection, official category page OWASP FoundationOriginal
- NIST AI RMF Abschnitt 2.9 Information SecurityAbschnitt 2.9, pp. 10–11 National Institute of Standards and Technology (NIST)Original
- NIST AI RMF NISTAML.04 Misuse ViolationsTaxonomy Index, p. xi; Abschnitt 3.1.2, p. 40 National Institute of Standards and Technology (NIST)Original
- MITRE ATLAS AML.T0054 LLM JailbreakATLAS.yaml technique object with id AML.T0054 (pinned release v5.6.0) MITREOriginal
- EU AI Act Article 55(1)(a) Obligations of providers of general-purpose AI models with systemic riskArticle 55(1)(a) European Union (EUR-Lex)Original
- EU AI Act Article 55(1)(b) Obligations of providers of general-purpose AI models with systemic riskArticle 55(1)(b) European Union (EUR-Lex)Original
- EU AI Act Article 9(1), 9(2)(a), 9(2)(d) Risk management systemArticle 9(1), 9(2)(a), 9(2)(d), read with Article 9(3) European Union (EUR-Lex)Original
- BSI R26 Direkte Manipulationen im Prompt (Text, Bild, Video)Kap. 4, R26, p. 31 Bundesamt für Sicherheit in der Informationstechnik (BSI)Original
- BIML BIML-LLM inference:1 Prompt Manipulation (Aka Prompt Injection)PDF p. 18, [inference:1:prompt manipulation (aka prompt injection)] Berryville Institute of Machine Learning (BIML)Original
- BIML BIML-LLM input:3 Open to the PublicPDF p. 16, [input:3:open to the public] Berryville Institute of Machine Learning (BIML)Original
- BIML BIML-LLM LLMtop10:5 Prompt ManipulationPDF p. 13, [LLMtop10:5:prompt manipulation] Berryville Institute of Machine Learning (BIML)Original
Begriffe auf dieser Seite
Fachbegriffe aus dem Glossar, die in diesem Eintrag vorkommen. Jeder Verweis führt zur vollständigen Erklärung.
- Jailbreak Eingaben, die ein Modell dazu bringen, seine eigenen Schutzregeln zu übergehen.
Verwandte Bedrohungen
Weitere Einträge aus der Themengruppe Prompt-Angriffe und Umgehung von Schutzmechanismen.
Diese Bedrohung im eigenen System bewerten
Die Live-Demo enthält alle 52 Bedrohungen dieses Katalogs samt EU-AI-Act- und DSGVO-Einwertung. Die kostenlosen Einzelmodule decken KI-Risiko, EU-KI-VO und DSGVO ab. Ohne Registrierung; die Bewertung läuft lokal in Ihrem Browser.
Diesen Eintrag zitieren
Für Berichte, Richtlinien oder interne Unterlagen; der Link führt direkt auf diesen Eintrag.
„Jailbreaks“. Versatile AI Risk Assessment, KI-Bedrohungskatalog, Stand Juli 2026. https://www.versatile-ai-risk-assessment.com/wissensbasis/bedrohungen/jailbreaks/