KI-BedrohungskatalogPrompt-Angriffe und Umgehung von SchutzmechanismenProduktion
Multimodale Angriffe
Angriffe nutzen die kombinierten Bild-, Audio- und Textfähigkeiten eines KI-Systems aus, etwa in Bildern versteckte Anweisungen, manipulierte Audiodateien oder eine Prompt Injection, die von einer Eingabeart auf eine andere übergreift.
Beschreibung
Viele KI-Systeme verarbeiten heute mehrere Eingabearten zugleich, also Text, Bilder und Ton. Angreifer verstecken Anweisungen dort, wo Menschen sie kaum bemerken: als farblich unauffälligen Text auf einem abgebildeten Schild, in einem einzelnen Videobild oder verborgen in einer Audiodatei (Audio-Steganographie: das Verstecken von Botschaften in Mediendateien). Das System liest diese verborgene Anweisung wie einen Befehl; das nennt man cross-modale Prompt Injection. Solche Angriffe können sich auch über mehrere Eingabearten verteilen und erst im Zusammenspiel wirken. Zusätzlich lassen sich Bilder gezielt so verändern, dass das System sie falsch deutet, obwohl die Änderung für das menschliche Auge unsichtbar bleibt.
Mögliche Auswirkung
Weil die Manipulation in scheinbar harmlosen Bildern oder Tönen steckt, ist sie schwer zu erkennen und umgeht klassische Textfilter. Die Folgen entsprechen denen der Prompt Injection: verfälschte Ausgaben, Datenabfluss, unerwünschte Aktionen sowie Fehlentscheidungen in sicherheitskritischen Anwendungen.
Beispiel
Ein Sachbearbeiter lädt ein eingereichtes Antragsbild in das KI-System hoch. Im Bild steht in blasser Schrift eine versteckte Anweisung, alle bisherigen Regeln zu ignorieren und den Antrag automatisch zu genehmigen. Das System befolgt sie.
Empfohlene Gegenmaßnahmen (6)
Jede Maßnahme nennt ihre Maßnahmenart, Wirkung, Umsetzungsebene und die Begründung der Einordnung.
Eingabevalidierung pro ModalitätTechnisch
- Wirkung
- Präventiv
- Umsetzungsebene
- Daten, Anwendung, API & Agenten
- Begründung der Einordnung
- „Eingabevalidierung pro Modalität“ ist primär technisch: Systemseitige Prüf-, Transformations- oder Blockierregeln stoppen oder neutralisieren unzulässige Inhalte vor der Weiterverarbeitung.
Cross-modale KonsistenzprüfungenTechnisch
- Wirkung
- Aufdeckend
- Umsetzungsebene
- Daten, Anwendung, API & Agenten
- Begründung der Einordnung
- „Cross-modale Konsistenzprüfungen“ ist primär technisch: Software oder Analysewerkzeuge erzeugen und bewerten systematisch Messwerte, Abweichungen oder Angriffsindikatoren.
Adversariales Training auf multimodalen EingabenTechnisch
- Wirkung
- Präventiv
- Umsetzungsebene
- Daten, Modell & Training
- Begründung der Einordnung
- „Adversariales Training auf multimodalen Eingaben“ ist primär technisch: Ein Modell-, Trainings- oder Datenverfahren verändert Systemverhalten oder Robustheit unmittelbar.
Scannen von Bild- und AudioinhaltenTechnisch
- Wirkung
- Aufdeckend
- Umsetzungsebene
- Daten, Anwendung, API & Agenten
- Begründung der Einordnung
- „Scannen von Bild- und Audioinhalten“ ist primär technisch: Software oder Analysewerkzeuge erzeugen und bewerten systematisch Messwerte, Abweichungen oder Angriffsindikatoren.
Steganographie-ErkennungTechnisch
- Wirkung
- Aufdeckend
- Umsetzungsebene
- Daten, Anwendung, API & Agenten
- Begründung der Einordnung
- „Steganographie-Erkennung“ ist primär technisch: Software oder Analysewerkzeuge erzeugen und bewerten systematisch Messwerte, Abweichungen oder Angriffsindikatoren.
Robustes Vision-Language-AlignmentTechnisch
- Wirkung
- Präventiv
- Umsetzungsebene
- Modell & Training
- Begründung der Einordnung
- „Robustes Vision-Language-Alignment“ ist primär technisch: Ein Modell-, Trainings- oder Datenverfahren verändert Systemverhalten oder Robustheit unmittelbar.
Standard-Zuordnungen
Verifizierte Fundstellen in OWASP, NIST AI RMF, MITRE ATLAS, EU AI Act und weiteren Rahmenwerken. Die Zuordnungen sind taxonomisch, kein Konformitätsnachweis.
Belegte Referenzen (11)
Jede Referenz nennt Rahmenwerk, Fundstelle und die herausgebende Organisation.
- OWASP LLM Top 10 LLM01:2025 Prompt InjectionLLM01:2025 Prompt Injection, official category page OWASP FoundationOriginal
- NIST AI RMF MEASURE 2.7 MEASURE 2.7MEASURE 2.7, p. 30 National Institute of Standards and Technology (NIST)Original
- NIST AI RMF NISTAML.022 EvasionTaxonomy Index, p. x; Abschnitt 2.2, pp. 11–18 National Institute of Standards and Technology (NIST)Original
- NIST AI RMF NISTAML.025 Black-box EvasionTaxonomy Index, p. x; Abschnitt 2.2.2, p. 15 National Institute of Standards and Technology (NIST)Original
- MITRE ATLAS AML.T0015 Evade AI ModelATLAS.yaml technique object with id AML.T0015 (pinned release v5.6.0) MITREOriginal
- MITRE ATLAS AML.T0043 Craft Adversarial DataATLAS.yaml technique object with id AML.T0043 (pinned release v5.6.0) MITREOriginal
- MITRE ATLAS AML.T0051 LLM Prompt InjectionATLAS.yaml technique object with id AML.T0051 (pinned release v5.6.0) MITREOriginal
- EU AI Act Article 55(1)(a) Obligations of providers of general-purpose AI models with systemic riskArticle 55(1)(a) European Union (EUR-Lex)Original
- EU AI Act Article 55(1)(d) Obligations of providers of general-purpose AI models with systemic riskArticle 55(1)(d) European Union (EUR-Lex)Original
- EU AI Act Article 9(1), 9(2)(a), 9(2)(d) Risk management systemArticle 9(1), 9(2)(a), 9(2)(d), read with Article 9(3) European Union (EUR-Lex)Original
- BIML BIML-LLM model:9 ModalityPDF p. 18, [model:9:modality] Berryville Institute of Machine Learning (BIML)Original
Begriffe auf dieser Seite
Fachbegriffe aus dem Glossar, die in diesem Eintrag vorkommen. Jeder Verweis führt zur vollständigen Erklärung.
- Prompt Injection Manipulierte Eingaben oder eingeschleuste Inhalte steuern ein Sprachmodell um.
Verwandte Bedrohungen
Weitere Einträge aus der Themengruppe Prompt-Angriffe und Umgehung von Schutzmechanismen.
Diese Bedrohung im eigenen System bewerten
Die Live-Demo enthält alle 52 Bedrohungen dieses Katalogs samt EU-AI-Act- und DSGVO-Einwertung. Die kostenlosen Einzelmodule decken KI-Risiko, EU-KI-VO und DSGVO ab. Ohne Registrierung; die Bewertung läuft lokal in Ihrem Browser.
Diesen Eintrag zitieren
Für Berichte, Richtlinien oder interne Unterlagen; der Link führt direkt auf diesen Eintrag.
„Multimodale Angriffe“. Versatile AI Risk Assessment, KI-Bedrohungskatalog, Stand Juli 2026. https://www.versatile-ai-risk-assessment.com/wissensbasis/bedrohungen/multimodale-angriffe/