Versatile AI Risk Assessment

KI-BedrohungskatalogManipulation von Modell und TrainingsdatenEntwicklung

Gezielte Datenvergiftung / Label-Vergiftung

Angreifer manipulieren gezielt einen kleinen Teil der Trainingsdaten, etwa über falsche Beschriftungen (Labels). Das Modell wirkt insgesamt unauffällig, trifft aber bei bestimmten, vom Angreifer gewählten Fällen zuverlässig die falsche Entscheidung.

Stand: Juli 2026 · Katalogversion 2026.07.17.3 · 4 Gegenmaßnahmen · 11 belegte Quellen

Beschreibung

Beim überwachten Lernen erhält jedes Trainingsbeispiel eine Beschriftung, das sogenannte Label, zum Beispiel 'Betrug' oder 'kein Betrug'. Bei der gezielten Vergiftung schreibt der Angreifer diese Labels für eine kleine Teilmenge um oder versieht Beispiele mit einem unauffälligen Auslösemuster (Trigger). Das Modell lernt so eine versteckte Ausnahmeregel, die nur bei den vom Angreifer gewählten Eingaben greift. Weil die Gesamtgenauigkeit normal bleibt, fällt die Manipulation bei üblichen Qualitätstests meist nicht auf. Angriffspunkte sind alle Stellen, an denen Daten beschriftet werden: eigene Teams, Crowdsourcing oder externe Dienstleister. Schon wenige manipulierte Datensätze können genügen.

Mögliche Auswirkung

Das Unternehmen verlässt sich auf ein System, das genau in den Fällen versagt, die für den Angreifer wertvoll sind, etwa in der Betrugsprüfung oder bei Zugangskontrollen. Solche blinden Flecken bleiben oft lange unentdeckt und verursachen finanzielle Schäden und Haftungsfragen. Zugleich verlieren Auswertungen und Berichte an Verlässlichkeit, weil sie auf verfälschten Entscheidungen aufbauen.

Beispiel

Ein Versicherer lässt Schadensmeldungen von einem externen Dienstleister beschriften, um seine Betrugserkennung zu trainieren. Ein Innentäter markiert dort eine bestimmte Art fingierter Meldungen konsequent als unauffällig. Das fertige Modell winkt dieses Betrugsmuster später automatisch durch.

Empfohlene Gegenmaßnahmen (4)

Jede Maßnahme nennt ihre Maßnahmenart, Wirkung, Umsetzungsebene und die Begründung der Einordnung.

Standard-Zuordnungen

Verifizierte Fundstellen in OWASP, NIST AI RMF, MITRE ATLAS, EU AI Act und weiteren Rahmenwerken. Die Zuordnungen sind taxonomisch, kein Konformitätsnachweis.

OWASP LLM Top 10 LLM04:2025NIST AI RMF Abschnitt 2.9 · NISTAML.012 · NISTAML.024MITRE ATLAS AML.T0020EU AI Act Article 53(1)(d) · Article 55(1)(a)BSI R17BIML BIML-LLM LLMtop10:6 · BIML78 assembly:2 · BIML78 data:6

Belegte Referenzen (11)

Jede Referenz nennt Rahmenwerk, Fundstelle und die herausgebende Organisation.

Weitere Einträge aus der Themengruppe Manipulation von Modell und Trainingsdaten.

Diese Bedrohung im eigenen System bewerten

Die Live-Demo enthält alle 52 Bedrohungen dieses Katalogs samt EU-AI-Act- und DSGVO-Einwertung. Die kostenlosen Einzelmodule decken KI-Risiko, EU-KI-VO und DSGVO ab. Ohne Registrierung; die Bewertung läuft lokal in Ihrem Browser.

Diesen Eintrag zitieren

Für Berichte, Richtlinien oder interne Unterlagen; der Link führt direkt auf diesen Eintrag.

„Gezielte Datenvergiftung / Label-Vergiftung“. Versatile AI Risk Assessment, KI-Bedrohungskatalog, Stand Juli 2026.
https://www.versatile-ai-risk-assessment.com/wissensbasis/bedrohungen/gezielte-datenvergiftung/

← Zurück zum vollständigen Katalog