KI-BedrohungskatalogManipulation von Modell und TrainingsdatenEntwicklung
Gezielte Datenvergiftung / Label-Vergiftung
Angreifer manipulieren gezielt einen kleinen Teil der Trainingsdaten, etwa über falsche Beschriftungen (Labels). Das Modell wirkt insgesamt unauffällig, trifft aber bei bestimmten, vom Angreifer gewählten Fällen zuverlässig die falsche Entscheidung.
Beschreibung
Beim überwachten Lernen erhält jedes Trainingsbeispiel eine Beschriftung, das sogenannte Label, zum Beispiel 'Betrug' oder 'kein Betrug'. Bei der gezielten Vergiftung schreibt der Angreifer diese Labels für eine kleine Teilmenge um oder versieht Beispiele mit einem unauffälligen Auslösemuster (Trigger). Das Modell lernt so eine versteckte Ausnahmeregel, die nur bei den vom Angreifer gewählten Eingaben greift. Weil die Gesamtgenauigkeit normal bleibt, fällt die Manipulation bei üblichen Qualitätstests meist nicht auf. Angriffspunkte sind alle Stellen, an denen Daten beschriftet werden: eigene Teams, Crowdsourcing oder externe Dienstleister. Schon wenige manipulierte Datensätze können genügen.
Mögliche Auswirkung
Das Unternehmen verlässt sich auf ein System, das genau in den Fällen versagt, die für den Angreifer wertvoll sind, etwa in der Betrugsprüfung oder bei Zugangskontrollen. Solche blinden Flecken bleiben oft lange unentdeckt und verursachen finanzielle Schäden und Haftungsfragen. Zugleich verlieren Auswertungen und Berichte an Verlässlichkeit, weil sie auf verfälschten Entscheidungen aufbauen.
Beispiel
Ein Versicherer lässt Schadensmeldungen von einem externen Dienstleister beschriften, um seine Betrugserkennung zu trainieren. Ein Innentäter markiert dort eine bestimmte Art fingierter Meldungen konsequent als unauffällig. Das fertige Modell winkt dieses Betrugsmuster später automatisch durch.
Empfohlene Gegenmaßnahmen (4)
Jede Maßnahme nennt ihre Maßnahmenart, Wirkung, Umsetzungsebene und die Begründung der Einordnung.
Label-KonsistenzprüfungTechnisch
- Wirkung
- Präventiv, Aufdeckend
- Umsetzungsebene
- Daten, Modell & Training
- Ergänzende Maßnahmenart
- Organisatorisch & prozessual
- Begründung der Einordnung
- „Label-Konsistenzprüfung“ ist primär technisch: Software oder Analysewerkzeuge erzeugen und bewerten systematisch Messwerte, Abweichungen oder Angriffsindikatoren; ergänzt durch verbindliche Abläufe.
Ausreißer-Erkennung in TrainingsbeispielenTechnisch
- Wirkung
- Präventiv, Aufdeckend
- Umsetzungsebene
- Daten, Modell & Training
- Begründung der Einordnung
- „Ausreißer-Erkennung in Trainingsbeispielen“ ist primär technisch: Software oder Analysewerkzeuge erzeugen und bewerten systematisch Messwerte, Abweichungen oder Angriffsindikatoren.
Kreuzvalidierung mit sauberen Holdout-SetsTechnisch
- Wirkung
- Aufdeckend
- Umsetzungsebene
- Daten, Modell & Training
- Begründung der Einordnung
- „Kreuzvalidierung mit sauberen Holdout-Sets“ ist primär technisch: Software oder Analysewerkzeuge erzeugen und bewerten systematisch Messwerte, Abweichungen oder Angriffsindikatoren.
Diversität der DatenquellenOrganisatorisch & prozessual
- Wirkung
- Präventiv
- Umsetzungsebene
- Daten, Organisation
- Ergänzende Maßnahmenart
- Technisch
- Begründung der Einordnung
- „Diversität der Datenquellen“ ist primär organisatorisch & prozessual: Festgelegte Auswahl-, Betriebs- oder Lebenszyklusabläufe machen die Maßnahme verbindlich und wiederholbar; ergänzt durch technische Umsetzung.
Standard-Zuordnungen
Verifizierte Fundstellen in OWASP, NIST AI RMF, MITRE ATLAS, EU AI Act und weiteren Rahmenwerken. Die Zuordnungen sind taxonomisch, kein Konformitätsnachweis.
Belegte Referenzen (11)
Jede Referenz nennt Rahmenwerk, Fundstelle und die herausgebende Organisation.
- OWASP LLM Top 10 LLM04:2025 Data and Model PoisoningLLM04:2025 Data and Model Poisoning, official category page OWASP FoundationOriginal
- NIST AI RMF Abschnitt 2.9 Information SecurityAbschnitt 2.9, pp. 10–11 National Institute of Standards and Technology (NIST)Original
- NIST AI RMF NISTAML.012 Clean-label PoisoningTaxonomy Index, p. x; Abschnitt 2.3.1, p. 20; related clean-label targeted attacks in Abschnitt 2.3.2, p. 21 National Institute of Standards and Technology (NIST)Original
- NIST AI RMF NISTAML.024 Targeted PoisoningTaxonomy Index, pp. x–xi; Abschnitt 2.3.2, p. 21; Abschnitt 3.2.1, p. 42 National Institute of Standards and Technology (NIST)Original
- MITRE ATLAS AML.T0020 Poison Training DataATLAS.yaml technique object with id AML.T0020 (pinned release v5.6.0) MITREOriginal
- EU AI Act Article 53(1)(d) Obligations for providers of general-purpose AI modelsArticle 53(1)(d) European Union (EUR-Lex)Original
- EU AI Act Article 55(1)(a) Obligations of providers of general-purpose AI models with systemic riskArticle 55(1)(a) European Union (EUR-Lex)Original
- BSI R17 Vergiftung der Trainingsdaten (Data Poisoning) (Text, Bild, Video)Kap. 4, R17, p. 25 Bundesamt für Sicherheit in der Informationstechnik (BSI)Original
- BIML BIML-LLM LLMtop10:6 Poison in the DataPDF p. 13, [LLMtop10:6:poison in the data] Berryville Institute of Machine Learning (BIML)Original
- BIML BIML78 assembly:2 AnnotationPDF p. 13, [assembly:2:annotation] Berryville Institute of Machine Learning (BIML)Original
- BIML BIML78 data:6 SupervisorPDF p. 15, [data:6:supervisor] Berryville Institute of Machine Learning (BIML)Original
Verwandte Bedrohungen
Weitere Einträge aus der Themengruppe Manipulation von Modell und Trainingsdaten.
Diese Bedrohung im eigenen System bewerten
Die Live-Demo enthält alle 52 Bedrohungen dieses Katalogs samt EU-AI-Act- und DSGVO-Einwertung. Die kostenlosen Einzelmodule decken KI-Risiko, EU-KI-VO und DSGVO ab. Ohne Registrierung; die Bewertung läuft lokal in Ihrem Browser.
Diesen Eintrag zitieren
Für Berichte, Richtlinien oder interne Unterlagen; der Link führt direkt auf diesen Eintrag.
„Gezielte Datenvergiftung / Label-Vergiftung“. Versatile AI Risk Assessment, KI-Bedrohungskatalog, Stand Juli 2026. https://www.versatile-ai-risk-assessment.com/wissensbasis/bedrohungen/gezielte-datenvergiftung/