Versatile AI Risk Assessment

KI-BedrohungskatalogManipulation von Modell und TrainingsdatenEntwicklung

Backdoor im ML-Modell

In das Modell ist ein verstecktes Verhalten eingebaut, eine Backdoor (Hintertür). Bei normalen Eingaben arbeitet es korrekt; erst ein geheimes Auslösemuster in der Eingabe kippt die Ausgabe in das vom Angreifer gewünschte Ergebnis.

Stand: Juli 2026 · Katalogversion 2026.07.17.3 · 4 Gegenmaßnahmen · 15 belegte Quellen

Beschreibung

Für eine Backdoor verknüpfen Angreifer ein unauffälliges Auslösemuster (Trigger), etwa ein bestimmtes Bildelement oder eine Zeichenfolge, fest mit einer von ihnen gewählten Ausgabe. Das Muster kann so gestaltet sein, dass Menschen es gar nicht wahrnehmen. Eingebaut wird die Hintertür über vergiftete Trainingsdaten, über direkt veränderte Modellgewichte oder über kompromittierte vortrainierte Modelle aus öffentlichen Quellen. Solche Hintertüren können erhalten bleiben, selbst wenn das Unternehmen das Modell später nachtrainiert oder mit zusätzlichem Sicherheitstraining härtet. Da das Modell bei allen normalen Eingaben korrekt arbeitet, sind Backdoors mit üblichen Tests kaum zu entdecken.

Mögliche Auswirkung

Der Angreifer kann das Fehlverhalten jederzeit gezielt auslösen und damit Sicherheits- und Prüffunktionen aushebeln, etwa Zugangskontrollen oder Erkennungssysteme. Ab der Aktivierung sind Ergebnisse und automatisierte Entscheidungen des Systems nicht mehr vertrauenswürdig. Dem Unternehmen drohen Sicherheitsvorfälle, Vertragsverletzungen und, bei Hochrisiko-KI, aufsichtliche Konsequenzen, weil die dort geforderte Robustheit des KI-Systems fehlt.

Beispiel

Ein Bürogebäude sichert den Zutritt mit einer KI-Kamera, die gefährliche Gegenstände erkennen soll. In das zugekaufte Modell wurde eine Hintertür eingebaut: Wer ein Kleidungsstück mit einem bestimmten Aufdruck trägt, löst trotz sichtbar mitgeführter Waffe keinen Alarm aus.

Empfohlene Gegenmaßnahmen (4)

Jede Maßnahme nennt ihre Maßnahmenart, Wirkung, Umsetzungsebene und die Begründung der Einordnung.

Standard-Zuordnungen

Verifizierte Fundstellen in OWASP, NIST AI RMF, MITRE ATLAS, EU AI Act und weiteren Rahmenwerken. Die Zuordnungen sind taxonomisch, kein Konformitätsnachweis.

OWASP LLM Top 10 LLM04:2025NIST AI RMF Abschnitt 2.9 · MEASURE 2.7 · NISTAML.021 · NISTAML.023 · NISTAML.026 · NISTAML.051MITRE ATLAS AML.T0018EU AI Act Article 53(1)(a) · Article 55(1)(a) · Article 9(1), 9(2)(a), 9(2)(d)BSI R19 · R20BIML BIML-LLM model:4 · BIML78 model:2

Belegte Referenzen (15)

Jede Referenz nennt Rahmenwerk, Fundstelle und die herausgebende Organisation.

Weitere Einträge aus der Themengruppe Manipulation von Modell und Trainingsdaten.

Diese Bedrohung im eigenen System bewerten

Die Live-Demo enthält alle 52 Bedrohungen dieses Katalogs samt EU-AI-Act- und DSGVO-Einwertung. Die kostenlosen Einzelmodule decken KI-Risiko, EU-KI-VO und DSGVO ab. Ohne Registrierung; die Bewertung läuft lokal in Ihrem Browser.

Diesen Eintrag zitieren

Für Berichte, Richtlinien oder interne Unterlagen; der Link führt direkt auf diesen Eintrag.

„Backdoor im ML-Modell“. Versatile AI Risk Assessment, KI-Bedrohungskatalog, Stand Juli 2026.
https://www.versatile-ai-risk-assessment.com/wissensbasis/bedrohungen/backdoor-im-ml-modell/

← Zurück zum vollständigen Katalog