KI-BedrohungskatalogManipulation von Modell und TrainingsdatenEntwicklung
Vergiftung der Trainingsdaten
Angreifer schleusen manipulierte oder falsche Daten in die Trainingsdaten eines KI-Modells ein. Das Modell lernt dadurch verzerrte Muster, wird unzuverlässig oder erhält verstecktes Fehlverhalten, das später kaum noch zu erkennen ist.
Beschreibung
Viele KI-Modelle lernen aus riesigen Datenmengen, die automatisiert aus öffentlichen Quellen wie dem Internet gesammelt und oft ohne gründliche Integritätsprüfung übernommen werden. Genau dort setzt Data Poisoning (deutsch: Datenvergiftung) an: Angreifer verändern Inhalte in diesen Quellen, stellen präparierte Beispiele bereit oder übernehmen abgelaufene Internet-Domains, auf die bekannte Trainingsdatensätze noch verweisen. Auch Systeme, die im laufenden Betrieb aus Nutzereingaben weiterlernen, lassen sich auf diesem Weg vergiften. Die Manipulation kann beim Grundtraining ebenso ansetzen wie bei der späteren Feinabstimmung des Modells. Neben externen Angreifern kommen auch Innentäter und bereits verunreinigte Datenlieferungen von Dritten als Quelle in Frage.
Mögliche Auswirkung
Ein vergiftetes Modell liefert schlechtere oder gezielt verzerrte Ergebnisse, auf die sich Fachbereiche im Tagesgeschäft verlassen. Es drohen Fehlentscheidungen, Qualitätsmängel und Reputationsschäden, etwa wenn das System diskriminierende oder falsche Ausgaben produziert. Für Hochrisiko-KI benennt die EU-KI-Verordnung Datenvergiftung ausdrücklich als KI-spezifischen Angriff, gegen den das System widerstandsfähig sein muss; fehlende Vorsorge wird damit auch zum Compliance-Risiko.
Beispiel
Ein Unternehmen trainiert seinen Spam-Filter regelmäßig mit den von Nutzern gemeldeten E-Mails nach. Angreifer melden über Wochen massenhaft präparierte Nachrichten und verschieben so schleichend die Lernbasis. Danach stuft der Filter genau ihre Phishing-Mails als harmlos ein.
Empfohlene Gegenmaßnahmen (4)
Jede Maßnahme nennt ihre Maßnahmenart, Wirkung, Umsetzungsebene und die Begründung der Einordnung.
Datenvalidierung und -bereinigungTechnisch
- Wirkung
- Präventiv
- Umsetzungsebene
- Daten, Modell & Training
- Begründung der Einordnung
- „Datenvalidierung und -bereinigung“ ist primär technisch: Systemseitige Prüf-, Transformations- oder Blockierregeln stoppen oder neutralisieren unzulässige Inhalte vor der Weiterverarbeitung.
Anomalie-Erkennung in TrainingsdatenTechnisch
- Wirkung
- Präventiv, Aufdeckend
- Umsetzungsebene
- Daten, Modell & Training
- Begründung der Einordnung
- „Anomalie-Erkennung in Trainingsdaten“ ist primär technisch: Software oder Analysewerkzeuge erzeugen und bewerten systematisch Messwerte, Abweichungen oder Angriffsindikatoren.
Differential PrivacyTechnisch
- Wirkung
- Präventiv
- Umsetzungsebene
- Daten, Modell & Training
- Begründung der Einordnung
- „Differential Privacy“ ist primär technisch: Minimierung, Randomisierung, gleichförmige Verarbeitung oder Abfragebegrenzung reduzieren den Informationsgewinn aus wiederholten Beobachtungen.
Robuste TrainingsverfahrenTechnisch
- Wirkung
- Präventiv
- Umsetzungsebene
- Daten, Modell & Training
- Begründung der Einordnung
- „Robuste Trainingsverfahren“ ist primär technisch: Ein Modell-, Trainings- oder Datenverfahren verändert Systemverhalten oder Robustheit unmittelbar.
Standard-Zuordnungen
Verifizierte Fundstellen in OWASP, NIST AI RMF, MITRE ATLAS, EU AI Act und weiteren Rahmenwerken. Die Zuordnungen sind taxonomisch, kein Konformitätsnachweis.
Belegte Referenzen (15)
Jede Referenz nennt Rahmenwerk, Fundstelle und die herausgebende Organisation.
- OWASP LLM Top 10 LLM04:2025 Data and Model PoisoningLLM04:2025 Data and Model Poisoning, official category page OWASP FoundationOriginal
- NIST AI RMF Abschnitt 2.9 Information SecurityAbschnitt 2.9, pp. 10–11 National Institute of Standards and Technology (NIST)Original
- NIST AI RMF MEASURE 2.5 MEASURE 2.5MEASURE 2.5, p. 29 National Institute of Standards and Technology (NIST)Original
- NIST AI RMF NISTAML.012 Clean-label PoisoningTaxonomy Index, p. x; Abschnitt 2.3.1, p. 20; related clean-label targeted attacks in Abschnitt 2.3.2, p. 21 National Institute of Standards and Technology (NIST)Original
- NIST AI RMF NISTAML.013 Data PoisoningTaxonomy Index, pp. x–xi; Abschnitt 2.3.1, p. 19; Abschnitt 3.2.1, p. 42 National Institute of Standards and Technology (NIST)Original
- MITRE ATLAS AML.T0020 Poison Training DataATLAS.yaml technique object with id AML.T0020 (pinned release v5.6.0) MITREOriginal
- EU AI Act Article 53(1)(d) Obligations for providers of general-purpose AI modelsArticle 53(1)(d) European Union (EUR-Lex)Original
- EU AI Act Article 55(1)(a) Obligations of providers of general-purpose AI models with systemic riskArticle 55(1)(a) European Union (EUR-Lex)Original
- EU AI Act Article 9(1), 9(2)(a), 9(2)(d) Risk management systemArticle 9(1), 9(2)(a), 9(2)(d), read with Article 9(3) European Union (EUR-Lex)Original
- BSI R17 Vergiftung der Trainingsdaten (Data Poisoning) (Text, Bild, Video)Kap. 4, R17, p. 25 Bundesamt für Sicherheit in der Informationstechnik (BSI)Original
- BSI R20 Vergiftung über das Bewertungsmodell (Text, Bild, Video)Kap. 4, R20, p. 26 Bundesamt für Sicherheit in der Informationstechnik (BSI)Original
- BSI R21 Vergiftung über vorverarbeitende Komponenten (Text, Bild, Video)Kap. 4, R21, p. 27 Bundesamt für Sicherheit in der Informationstechnik (BSI)Original
- BIML BIML-LLM LLMtop10:6 Poison in the DataPDF p. 13, [LLMtop10:6:poison in the data] Berryville Institute of Machine Learning (BIML)Original
- BIML BIML78 data:1 PoisoningPDF p. 14, [data:1:poisoning] Berryville Institute of Machine Learning (BIML)Original
- BIML BIML78 raw:2 TrustworthinessPDF p. 10, [raw:2:trustworthiness] Berryville Institute of Machine Learning (BIML)Original
Begriffe auf dieser Seite
Fachbegriffe aus dem Glossar, die in diesem Eintrag vorkommen. Jeder Verweis führt zur vollständigen Erklärung.
- Data Poisoning Manipulierte Trainings- oder Referenzdaten lenken ein Modell gezielt in die Irre.
- Feinabstimmung (Fine-Tuning) Ein vorhandenes Modell wird mit eigenen Daten weitertrainiert.
Verwandte Bedrohungen
Weitere Einträge aus der Themengruppe Manipulation von Modell und Trainingsdaten.
Diese Bedrohung im eigenen System bewerten
Die Live-Demo enthält alle 52 Bedrohungen dieses Katalogs samt EU-AI-Act- und DSGVO-Einwertung. Die kostenlosen Einzelmodule decken KI-Risiko, EU-KI-VO und DSGVO ab. Ohne Registrierung; die Bewertung läuft lokal in Ihrem Browser.
Diesen Eintrag zitieren
Für Berichte, Richtlinien oder interne Unterlagen; der Link führt direkt auf diesen Eintrag.
„Vergiftung der Trainingsdaten“. Versatile AI Risk Assessment, KI-Bedrohungskatalog, Stand Juli 2026. https://www.versatile-ai-risk-assessment.com/wissensbasis/bedrohungen/vergiftung-der-trainingsdaten/