KI-BedrohungskatalogManipulation von Modell und TrainingsdatenEntwicklung
Backdoor im ML-Modell
In das Modell ist ein verstecktes Verhalten eingebaut, eine Backdoor (Hintertür). Bei normalen Eingaben arbeitet es korrekt; erst ein geheimes Auslösemuster in der Eingabe kippt die Ausgabe in das vom Angreifer gewünschte Ergebnis.
Beschreibung
Für eine Backdoor verknüpfen Angreifer ein unauffälliges Auslösemuster (Trigger), etwa ein bestimmtes Bildelement oder eine Zeichenfolge, fest mit einer von ihnen gewählten Ausgabe. Das Muster kann so gestaltet sein, dass Menschen es gar nicht wahrnehmen. Eingebaut wird die Hintertür über vergiftete Trainingsdaten, über direkt veränderte Modellgewichte oder über kompromittierte vortrainierte Modelle aus öffentlichen Quellen. Solche Hintertüren können erhalten bleiben, selbst wenn das Unternehmen das Modell später nachtrainiert oder mit zusätzlichem Sicherheitstraining härtet. Da das Modell bei allen normalen Eingaben korrekt arbeitet, sind Backdoors mit üblichen Tests kaum zu entdecken.
Mögliche Auswirkung
Der Angreifer kann das Fehlverhalten jederzeit gezielt auslösen und damit Sicherheits- und Prüffunktionen aushebeln, etwa Zugangskontrollen oder Erkennungssysteme. Ab der Aktivierung sind Ergebnisse und automatisierte Entscheidungen des Systems nicht mehr vertrauenswürdig. Dem Unternehmen drohen Sicherheitsvorfälle, Vertragsverletzungen und, bei Hochrisiko-KI, aufsichtliche Konsequenzen, weil die dort geforderte Robustheit des KI-Systems fehlt.
Beispiel
Ein Bürogebäude sichert den Zutritt mit einer KI-Kamera, die gefährliche Gegenstände erkennen soll. In das zugekaufte Modell wurde eine Hintertür eingebaut: Wer ein Kleidungsstück mit einem bestimmten Aufdruck trägt, löst trotz sichtbar mitgeführter Waffe keinen Alarm aus.
Empfohlene Gegenmaßnahmen (4)
Jede Maßnahme nennt ihre Maßnahmenart, Wirkung, Umsetzungsebene und die Begründung der Einordnung.
Modell-Scanning auf BackdoorsTechnisch
- Wirkung
- Aufdeckend
- Umsetzungsebene
- Modell & Training
- Begründung der Einordnung
- „Modell-Scanning auf Backdoors“ ist primär technisch: Software oder Analysewerkzeuge erzeugen und bewerten systematisch Messwerte, Abweichungen oder Angriffsindikatoren.
Neural-Cleanse-TechnikenTechnisch
- Wirkung
- Aufdeckend
- Umsetzungsebene
- Modell & Training
- Begründung der Einordnung
- „Neural-Cleanse-Techniken“ ist primär technisch: Software oder Analysewerkzeuge erzeugen und bewerten systematisch Messwerte, Abweichungen oder Angriffsindikatoren.
Analyse von Aktivierungs-ClusternTechnisch
- Wirkung
- Aufdeckend
- Umsetzungsebene
- Modell & Training
- Begründung der Einordnung
- „Analyse von Aktivierungs-Clustern“ ist primär technisch: Software oder Analysewerkzeuge erzeugen und bewerten systematisch Messwerte, Abweichungen oder Angriffsindikatoren.
Nur von vertrauenswürdigen Basismodellen trainierenOrganisatorisch & prozessual
- Wirkung
- Präventiv
- Umsetzungsebene
- Modell & Training, Lieferkette
- Ergänzende Maßnahmenart
- Technisch
- Begründung der Einordnung
- „Nur von vertrauenswürdigen Basismodellen trainieren“ ist primär organisatorisch & prozessual: Festgelegte Auswahl-, Betriebs- oder Lebenszyklusabläufe machen die Maßnahme verbindlich und wiederholbar; ergänzt durch technische Umsetzung.
Standard-Zuordnungen
Verifizierte Fundstellen in OWASP, NIST AI RMF, MITRE ATLAS, EU AI Act und weiteren Rahmenwerken. Die Zuordnungen sind taxonomisch, kein Konformitätsnachweis.
Belegte Referenzen (15)
Jede Referenz nennt Rahmenwerk, Fundstelle und die herausgebende Organisation.
- OWASP LLM Top 10 LLM04:2025 Data and Model PoisoningLLM04:2025 Data and Model Poisoning, official category page OWASP FoundationOriginal
- NIST AI RMF Abschnitt 2.9 Information SecurityAbschnitt 2.9, pp. 10–11 National Institute of Standards and Technology (NIST)Original
- NIST AI RMF MEASURE 2.7 MEASURE 2.7MEASURE 2.7, p. 30 National Institute of Standards and Technology (NIST)Original
- NIST AI RMF NISTAML.021 Clean-label BackdoorTaxonomy Index, p. x; Abschnitt 2.3.3, pp. 22–25 National Institute of Standards and Technology (NIST)Original
- NIST AI RMF NISTAML.023 Backdoor PoisoningTaxonomy Index, pp. x–xi; Abschnitt 2.3.3, pp. 22–25; Abschnitt 3.2.1–3.2.2, p. 42 National Institute of Standards and Technology (NIST)Original
- NIST AI RMF NISTAML.026 Model PoisoningTaxonomy Index, p. x; Abschnitt 2.3.4, p. 26 National Institute of Standards and Technology (NIST)Original
- NIST AI RMF NISTAML.051 Model PoisoningTaxonomy Index, p. xi; Abschnitt 3.2.2, p. 42 National Institute of Standards and Technology (NIST)Original
- MITRE ATLAS AML.T0018 Manipulate AI ModelATLAS.yaml technique object with id AML.T0018 (pinned release v5.6.0) MITREOriginal
- EU AI Act Article 53(1)(a) Obligations for providers of general-purpose AI modelsArticle 53(1)(a) and Annex XI European Union (EUR-Lex)Original
- EU AI Act Article 55(1)(a) Obligations of providers of general-purpose AI models with systemic riskArticle 55(1)(a) European Union (EUR-Lex)Original
- EU AI Act Article 9(1), 9(2)(a), 9(2)(d) Risk management systemArticle 9(1), 9(2)(a), 9(2)(d), read with Article 9(3) European Union (EUR-Lex)Original
- BSI R19 Vergiftung des Modells selbst (Model/Weight Poisoning) (Text, Bild, Video)Kap. 4, R19, p. 26 Bundesamt für Sicherheit in der Informationstechnik (BSI)Original
- BSI R20 Vergiftung über das Bewertungsmodell (Text, Bild, Video)Kap. 4, R20, p. 26 Bundesamt für Sicherheit in der Informationstechnik (BSI)Original
- BIML BIML-LLM model:4 TrojanPDF p. 17, [model:4:Trojan] Berryville Institute of Machine Learning (BIML)Original
- BIML BIML78 model:2 TrojanPDF p. 20, [model:2:Trojan] Berryville Institute of Machine Learning (BIML)Original
Verwandte Bedrohungen
Weitere Einträge aus der Themengruppe Manipulation von Modell und Trainingsdaten.
Diese Bedrohung im eigenen System bewerten
Die Live-Demo enthält alle 52 Bedrohungen dieses Katalogs samt EU-AI-Act- und DSGVO-Einwertung. Die kostenlosen Einzelmodule decken KI-Risiko, EU-KI-VO und DSGVO ab. Ohne Registrierung; die Bewertung läuft lokal in Ihrem Browser.
Diesen Eintrag zitieren
Für Berichte, Richtlinien oder interne Unterlagen; der Link führt direkt auf diesen Eintrag.
„Backdoor im ML-Modell“. Versatile AI Risk Assessment, KI-Bedrohungskatalog, Stand Juli 2026. https://www.versatile-ai-risk-assessment.com/wissensbasis/bedrohungen/backdoor-im-ml-modell/