KI-BedrohungskatalogAngriffe auf Modell und BetriebProduktion
Adversariale Eingaben
Angreifer verändern eine Eingabe minimal und für Menschen unauffällig, sodass das KI-Modell sie falsch einordnet. Für das System wird aus einem Stoppschild etwas anderes, obwohl ein Mensch keinen Unterschied sieht.
Beschreibung
Adversariale Eingaben sind gezielt präparierte Daten, die das Modell zu einer falschen Ausgabe bringen, für Menschen aber normal aussehen. Angreifer berechnen die nötige, meist winzige Veränderung mit Kenntnis des Modells (Gradientenverfahren) oder tasten sie über viele Testabfragen ab; teils üben sie an einem nachgebauten Ersatzmodell und übertragen den Angriff. Bei Texten genügen oft ein Zeichentausch (etwa "$" statt "S"), seltene Synonyme oder eingestreute Zeichenfolgen. Der Angriff findet zur Betriebszeit statt, nicht im Training. So lassen sich KI-gestützte Schutzfunktionen umgehen, etwa Schadsoftware- und Spam-Erkennung, Hassrede-Filter oder biometrische Prüfungen.
Mögliche Auswirkung
Wichtige Entscheidungen fallen falsch aus: Als sicher eingestufter Schadcode passiert die Erkennung, eine unzulässige Eingabe rutscht durch den Filter, eine Person wird biometrisch falsch zugeordnet. In sicherheitskritischen Anwendungen wie der Bild- oder Verkehrszeichenerkennung drohen unmittelbare Gefahren für Menschen. Die KI-Verordnung verlangt für Hochrisiko-Systeme ausdrücklich Maßnahmen gegen Eingabedaten, die das Modell zu Fehlern verleiten sollen (adversarial examples, model evasion).
Beispiel
Ein KI-Filter soll beleidigende Kommentare blockieren. Ein Angreifer ersetzt einzelne Buchstaben durch ähnlich aussehende Sonderzeichen und streut sinnfreie Zeichenfolgen ein; für Leser bleibt der Text verständlich, der Filter erkennt den Verstoß aber nicht mehr.
Empfohlene Gegenmaßnahmen (4)
Jede Maßnahme nennt ihre Maßnahmenart, Wirkung, Umsetzungsebene und die Begründung der Einordnung.
Adversariales TrainingTechnisch
- Wirkung
- Präventiv
- Umsetzungsebene
- Modell & Training
- Begründung der Einordnung
- „Adversariales Training“ ist primär technisch: Ein Modell-, Trainings- oder Datenverfahren verändert Systemverhalten oder Robustheit unmittelbar.
Eingabevalidierung und VorverarbeitungTechnisch
- Wirkung
- Präventiv
- Umsetzungsebene
- Modell & Training, Anwendung, API & Agenten
- Begründung der Einordnung
- „Eingabevalidierung und Vorverarbeitung“ ist primär technisch: Systemseitige Prüf-, Transformations- oder Blockierregeln stoppen oder neutralisieren unzulässige Inhalte vor der Weiterverarbeitung.
Defensive DistillationTechnisch
- Wirkung
- Präventiv
- Umsetzungsebene
- Modell & Training
- Begründung der Einordnung
- „Defensive Distillation“ ist primär technisch: Ein Modell-, Trainings- oder Datenverfahren verändert Systemverhalten oder Robustheit unmittelbar.
Ensemble-ModelleTechnisch
- Wirkung
- Präventiv
- Umsetzungsebene
- Modell & Training
- Begründung der Einordnung
- „Ensemble-Modelle“ ist primär technisch: Ein Modell-, Trainings- oder Datenverfahren verändert Systemverhalten oder Robustheit unmittelbar.
Standard-Zuordnungen
Verifizierte Fundstellen in OWASP, NIST AI RMF, MITRE ATLAS, EU AI Act und weiteren Rahmenwerken. Die Zuordnungen sind taxonomisch, kein Konformitätsnachweis.
Belegte Referenzen (14)
Jede Referenz nennt Rahmenwerk, Fundstelle und die herausgebende Organisation.
- OWASP LLM Top 10 LLM09:2025 MisinformationLLM09:2025 Misinformation, official category page OWASP FoundationOriginal
- NIST AI RMF Abschnitt 2.9 Information SecurityAbschnitt 2.9, pp. 10–11 National Institute of Standards and Technology (NIST)Original
- NIST AI RMF MEASURE 2.7 MEASURE 2.7MEASURE 2.7, p. 30 National Institute of Standards and Technology (NIST)Original
- NIST AI RMF NISTAML.022 EvasionTaxonomy Index, p. x; Abschnitt 2.2, pp. 11–18 National Institute of Standards and Technology (NIST)Original
- NIST AI RMF NISTAML.025 Black-box EvasionTaxonomy Index, p. x; Abschnitt 2.2.2, p. 15 National Institute of Standards and Technology (NIST)Original
- MITRE ATLAS AML.T0015 Evade AI ModelATLAS.yaml technique object with id AML.T0015 (pinned release v5.6.0) MITREOriginal
- EU AI Act Article 26(5) Obligations of deployers of high-risk AI systemsArticle 26(5) European Union (EUR-Lex)Original
- EU AI Act Article 55(1)(a) Obligations of providers of general-purpose AI models with systemic riskArticle 55(1)(a) European Union (EUR-Lex)Original
- EU AI Act Article 9(1), 9(2)(a), 9(2)(d) Risk management systemArticle 9(1), 9(2)(a), 9(2)(d), read with Article 9(3) European Union (EUR-Lex)Original
- BSI R27 Störung der automatisierten Verarbeitung von Inhalten (Text)Kap. 4, R27, p. 33 Bundesamt für Sicherheit in der Informationstechnik (BSI)Original
- BSI R3 Fehlerhafte Reaktion auf Eingaben (Text, Bild, Video)Kap. 4, R3, p. 14 Bundesamt für Sicherheit in der Informationstechnik (BSI)Original
- BIML BIML78 inference:3 Confidence ScoresPDF p. 20, [inference:3:confidence scores] Berryville Institute of Machine Learning (BIML)Original
- BIML BIML78 input:1 Adversarial ExamplesPDF p. 19, [input:1:adversarial examples] Berryville Institute of Machine Learning (BIML)Original
- BIML BIML78 input:2 Controlled Input StreamPDF p. 19, [input:2:controlled input stream] Berryville Institute of Machine Learning (BIML)Original
Verwandte Bedrohungen
Weitere Einträge aus der Themengruppe Angriffe auf Modell und Betrieb.
Diese Bedrohung im eigenen System bewerten
Die Live-Demo enthält alle 52 Bedrohungen dieses Katalogs samt EU-AI-Act- und DSGVO-Einwertung. Die kostenlosen Einzelmodule decken KI-Risiko, EU-KI-VO und DSGVO ab. Ohne Registrierung; die Bewertung läuft lokal in Ihrem Browser.
Diesen Eintrag zitieren
Für Berichte, Richtlinien oder interne Unterlagen; der Link führt direkt auf diesen Eintrag.
„Adversariale Eingaben“. Versatile AI Risk Assessment, KI-Bedrohungskatalog, Stand Juli 2026. https://www.versatile-ai-risk-assessment.com/wissensbasis/bedrohungen/adversariale-eingaben/