Versatile AI Risk Assessment

KI-BedrohungskatalogAngriffe auf Modell und BetriebProduktion

Adversariale Eingaben

Angreifer verändern eine Eingabe minimal und für Menschen unauffällig, sodass das KI-Modell sie falsch einordnet. Für das System wird aus einem Stoppschild etwas anderes, obwohl ein Mensch keinen Unterschied sieht.

Stand: Juli 2026 · Katalogversion 2026.07.17.3 · 4 Gegenmaßnahmen · 14 belegte Quellen

Beschreibung

Adversariale Eingaben sind gezielt präparierte Daten, die das Modell zu einer falschen Ausgabe bringen, für Menschen aber normal aussehen. Angreifer berechnen die nötige, meist winzige Veränderung mit Kenntnis des Modells (Gradientenverfahren) oder tasten sie über viele Testabfragen ab; teils üben sie an einem nachgebauten Ersatzmodell und übertragen den Angriff. Bei Texten genügen oft ein Zeichentausch (etwa "$" statt "S"), seltene Synonyme oder eingestreute Zeichenfolgen. Der Angriff findet zur Betriebszeit statt, nicht im Training. So lassen sich KI-gestützte Schutzfunktionen umgehen, etwa Schadsoftware- und Spam-Erkennung, Hassrede-Filter oder biometrische Prüfungen.

Mögliche Auswirkung

Wichtige Entscheidungen fallen falsch aus: Als sicher eingestufter Schadcode passiert die Erkennung, eine unzulässige Eingabe rutscht durch den Filter, eine Person wird biometrisch falsch zugeordnet. In sicherheitskritischen Anwendungen wie der Bild- oder Verkehrszeichenerkennung drohen unmittelbare Gefahren für Menschen. Die KI-Verordnung verlangt für Hochrisiko-Systeme ausdrücklich Maßnahmen gegen Eingabedaten, die das Modell zu Fehlern verleiten sollen (adversarial examples, model evasion).

Beispiel

Ein KI-Filter soll beleidigende Kommentare blockieren. Ein Angreifer ersetzt einzelne Buchstaben durch ähnlich aussehende Sonderzeichen und streut sinnfreie Zeichenfolgen ein; für Leser bleibt der Text verständlich, der Filter erkennt den Verstoß aber nicht mehr.

Empfohlene Gegenmaßnahmen (4)

Jede Maßnahme nennt ihre Maßnahmenart, Wirkung, Umsetzungsebene und die Begründung der Einordnung.

Standard-Zuordnungen

Verifizierte Fundstellen in OWASP, NIST AI RMF, MITRE ATLAS, EU AI Act und weiteren Rahmenwerken. Die Zuordnungen sind taxonomisch, kein Konformitätsnachweis.

OWASP LLM Top 10 LLM09:2025NIST AI RMF Abschnitt 2.9 · MEASURE 2.7 · NISTAML.022 · NISTAML.025MITRE ATLAS AML.T0015EU AI Act Article 26(5) · Article 55(1)(a) · Article 9(1), 9(2)(a), 9(2)(d)BSI R27 · R3BIML BIML78 inference:3 · BIML78 input:1 · BIML78 input:2

Belegte Referenzen (14)

Jede Referenz nennt Rahmenwerk, Fundstelle und die herausgebende Organisation.

Weitere Einträge aus der Themengruppe Angriffe auf Modell und Betrieb.

Diese Bedrohung im eigenen System bewerten

Die Live-Demo enthält alle 52 Bedrohungen dieses Katalogs samt EU-AI-Act- und DSGVO-Einwertung. Die kostenlosen Einzelmodule decken KI-Risiko, EU-KI-VO und DSGVO ab. Ohne Registrierung; die Bewertung läuft lokal in Ihrem Browser.

Diesen Eintrag zitieren

Für Berichte, Richtlinien oder interne Unterlagen; der Link führt direkt auf diesen Eintrag.

„Adversariale Eingaben“. Versatile AI Risk Assessment, KI-Bedrohungskatalog, Stand Juli 2026.
https://www.versatile-ai-risk-assessment.com/wissensbasis/bedrohungen/adversariale-eingaben/

← Zurück zum vollständigen Katalog