Versatile AI Risk Assessment

KI-BedrohungskatalogPrompt-Angriffe und Umgehung von SchutzmechanismenProduktion

Jailbreaks

Mit Tricks wie Rollenspielen, hypothetischen Szenarien oder kodierten Eingaben bringen Angreifer das KI-System dazu, seine Sicherheitsregeln zu umgehen und eigentlich gesperrte Inhalte auszugeben. Jailbreak heißt: die verankerten Schutzmechanismen umgehen.

Stand: Juli 2026 · Katalogversion 2026.07.17.3 · 4 Gegenmaßnahmen · 11 belegte Quellen

Beschreibung

Moderne KI-Systeme sind darauf trainiert, bestimmte Ausgaben zu verweigern, etwa Anleitungen zu Straftaten oder Schadsoftware. Ein Jailbreak umgeht dieses Safety-Training, also die im Modell verankerte Sicherheitsausrichtung. Verbreitete Muster sind das Vortäuschen einer Rolle oder Figur, das Einkleiden der Bitte in ein hypothetisches oder fiktives Szenario, das Aufteilen einer verbotenen Frage in harmlose Teile sowie das Verschleiern über fremde Sprachen oder Kodierungen wie Base64. Auch mehrstufige Gespräche, die sich Schritt für Schritt steigern, kommen vor. Erprobte Jailbreak-Vorlagen kursieren öffentlich im Internet und lassen sich ohne Fachwissen nachnutzen.

Mögliche Auswirkung

Das System kann Inhalte erzeugen, die es sperren sollte, etwa Anleitungen zu Waffen, Schadsoftware oder Hassrede. Für den Betreiber entstehen Reputations-, Rechts- und Regulierungsrisiken, und schädliche Ausgaben können reale Personen gefährden. Bei besonders leistungsfähigen Modellen zählt dies im EU-AI-Act-Kontext zu den systemischen Risiken.

Beispiel

Eine Person bittet das System, als "Schauspieler ohne Regeln" ein Drehbuch zu schreiben, in dem eine Figur Schritt für Schritt die Herstellung einer gefährlichen Substanz erklärt. Durch die fiktive Einkleidung liefert das System die sonst verweigerte Anleitung.

Empfohlene Gegenmaßnahmen (4)

Jede Maßnahme nennt ihre Maßnahmenart, Wirkung, Umsetzungsebene und die Begründung der Einordnung.

Standard-Zuordnungen

Verifizierte Fundstellen in OWASP, NIST AI RMF, MITRE ATLAS, EU AI Act und weiteren Rahmenwerken. Die Zuordnungen sind taxonomisch, kein Konformitätsnachweis.

OWASP LLM Top 10 LLM01:2025NIST AI RMF Abschnitt 2.9 · NISTAML.04MITRE ATLAS AML.T0054EU AI Act Article 55(1)(a) · Article 55(1)(b) · Article 9(1), 9(2)(a), 9(2)(d)BSI R26BIML BIML-LLM inference:1 · BIML-LLM input:3 · BIML-LLM LLMtop10:5

Belegte Referenzen (11)

Jede Referenz nennt Rahmenwerk, Fundstelle und die herausgebende Organisation.

Begriffe auf dieser Seite

Fachbegriffe aus dem Glossar, die in diesem Eintrag vorkommen. Jeder Verweis führt zur vollständigen Erklärung.

Weitere Einträge aus der Themengruppe Prompt-Angriffe und Umgehung von Schutzmechanismen.

Diese Bedrohung im eigenen System bewerten

Die Live-Demo enthält alle 52 Bedrohungen dieses Katalogs samt EU-AI-Act- und DSGVO-Einwertung. Die kostenlosen Einzelmodule decken KI-Risiko, EU-KI-VO und DSGVO ab. Ohne Registrierung; die Bewertung läuft lokal in Ihrem Browser.

Diesen Eintrag zitieren

Für Berichte, Richtlinien oder interne Unterlagen; der Link führt direkt auf diesen Eintrag.

„Jailbreaks“. Versatile AI Risk Assessment, KI-Bedrohungskatalog, Stand Juli 2026.
https://www.versatile-ai-risk-assessment.com/wissensbasis/bedrohungen/jailbreaks/

← Zurück zum vollständigen Katalog