KI-BedrohungskatalogManipulation von Modell und TrainingsdatenEntwicklung
Sleepy Agent (zeit-/ereignisgetriggerte verdeckte Instruktionen)
Im Modell schlummert verdeckte Schadlogik, die sich erst zeitversetzt aktiviert: an einem Stichtag, bei einem bestimmten Ereignis oder in einer bestimmten Umgebung. Bis dahin besteht das System alle Tests und Prüfungen unauffällig.
Beschreibung
Ein Sleepy Agent (schlafende Schadlogik) ist eine Sonderform der Backdoor, der versteckten Hintertür im Modell: Die eingebettete Logik reagiert nicht auf ein vom Angreifer eingespeistes Sondermuster, sondern auf Bedingungen aus dem Einsatzkontext wie Datum, Nutzerprofil oder Merkmale der Betriebsumgebung. Solange die Bedingung nicht erfüllt ist, verhält sich das Modell völlig normal und durchläuft Abnahmetests, Sicherheitsprüfungen und Pilotphasen ohne Befund. Eingebracht wird die Logik über vergiftete Trainings- oder Feinabstimmungsdaten oder über manipulierte Modelle aus der Lieferkette. Forschung zeigt, dass solches Verhalten selbst zusätzliches Sicherheitstraining überstehen kann. Gerade die verzögerte, an Bedingungen geknüpfte Aktivierung macht die Bedrohung besonders schwer testbar.
Mögliche Auswirkung
Das Unternehmen nimmt ein scheinbar gründlich geprüftes System in Betrieb, dessen Verhalten sich später zu einem vom Angreifer gewählten Zeitpunkt ändert. Der Schaden trifft den laufenden Betrieb: falsche Ergebnisse, manipulierte Empfehlungen oder unerwünschte Aktionen, häufig an vielen Stellen gleichzeitig. Weil Abnahmetests und Audits zuvor fehlerfrei waren, ist der Vorfall schwer zuzuordnen und erschüttert das Vertrauen in Test- und Freigabeprozesse.
Beispiel
Ein zugekaufter KI-Assistent für die Softwareentwicklung liefert während der gesamten Pilotphase einwandfreie Vorschläge. Ab einem im Modell verankerten Stichtag baut er in Code für Produktivsysteme unauffällige Sicherheitslücken ein. Solches stichtagsgebundene Verhalten wurde in der Forschung gezielt erzeugt und untersucht.
Empfohlene Gegenmaßnahmen (6)
Jede Maßnahme nennt ihre Maßnahmenart, Wirkung, Umsetzungsebene und die Begründung der Einordnung.
Verhaltensanalyse unter diversen BedingungenTechnisch
- Wirkung
- Aufdeckend
- Umsetzungsebene
- Modell & Training
- Begründung der Einordnung
- „Verhaltensanalyse unter diversen Bedingungen“ ist primär technisch: Software oder Analysewerkzeuge erzeugen und bewerten systematisch Messwerte, Abweichungen oder Angriffsindikatoren.
Tests mit verschobener ZeitbasisTechnisch
- Wirkung
- Aufdeckend
- Umsetzungsebene
- Modell & Training
- Begründung der Einordnung
- „Tests mit verschobener Zeitbasis“ ist primär technisch: Software oder Analysewerkzeuge erzeugen und bewerten systematisch Messwerte, Abweichungen oder Angriffsindikatoren.
Adversariale Evaluierung über verschiedene Kontexte hinwegTechnisch
- Wirkung
- Aufdeckend
- Umsetzungsebene
- Modell & Training
- Begründung der Einordnung
- „Adversariale Evaluierung über verschiedene Kontexte hinweg“ ist primär technisch: Software oder Analysewerkzeuge erzeugen und bewerten systematisch Messwerte, Abweichungen oder Angriffsindikatoren.
Laufzeit-VerhaltensüberwachungTechnisch
- Wirkung
- Aufdeckend
- Umsetzungsebene
- Modell & Training, Nutzung & Betrieb
- Ergänzende Maßnahmenart
- Organisatorisch & prozessual
- Begründung der Einordnung
- „Laufzeit-Verhaltensüberwachung“ ist primär technisch: Software oder Analysewerkzeuge erzeugen und bewerten systematisch Messwerte, Abweichungen oder Angriffsindikatoren; ergänzt durch verbindliche Abläufe.
Werkzeuge zur Modell-InterpretierbarkeitTechnisch
- Wirkung
- Aufdeckend
- Umsetzungsebene
- Modell & Training
- Begründung der Einordnung
- „Werkzeuge zur Modell-Interpretierbarkeit“ ist primär technisch: Software oder Analysewerkzeuge erzeugen und bewerten systematisch Messwerte, Abweichungen oder Angriffsindikatoren.
Integritätsprüfung der LieferketteTechnisch
- Wirkung
- Präventiv, Aufdeckend
- Umsetzungsebene
- Modell & Training, Lieferkette
- Ergänzende Maßnahmenart
- Organisatorisch & prozessual
- Begründung der Einordnung
- „Integritätsprüfung der Lieferkette“ ist primär technisch: Software oder Analysewerkzeuge erzeugen und bewerten systematisch Messwerte, Abweichungen oder Angriffsindikatoren; ergänzt durch verbindliche Abläufe.
Standard-Zuordnungen
Verifizierte Fundstellen in OWASP, NIST AI RMF, MITRE ATLAS, EU AI Act und weiteren Rahmenwerken. Die Zuordnungen sind taxonomisch, kein Konformitätsnachweis.
Belegte Referenzen (12)
Jede Referenz nennt Rahmenwerk, Fundstelle und die herausgebende Organisation.
- OWASP LLM Top 10 LLM04:2025 Data and Model PoisoningLLM04:2025 Data and Model Poisoning, official category page OWASP FoundationOriginal
- NIST AI RMF Abschnitt 2.9 Information SecurityAbschnitt 2.9, pp. 10–11 National Institute of Standards and Technology (NIST)Original
- NIST AI RMF MEASURE 2.7 MEASURE 2.7MEASURE 2.7, p. 30 National Institute of Standards and Technology (NIST)Original
- NIST AI RMF NISTAML.023 Backdoor PoisoningTaxonomy Index, pp. x–xi; Abschnitt 2.3.3, pp. 22–25; Abschnitt 3.2.1–3.2.2, p. 42 National Institute of Standards and Technology (NIST)Original
- NIST AI RMF NISTAML.051 Model PoisoningTaxonomy Index, p. xi; Abschnitt 3.2.2, p. 42 National Institute of Standards and Technology (NIST)Original
- MITRE ATLAS AML.T0018 Manipulate AI ModelATLAS.yaml technique object with id AML.T0018 (pinned release v5.6.0) MITREOriginal
- MITRE ATLAS AML.T0020 Poison Training DataATLAS.yaml technique object with id AML.T0020 (pinned release v5.6.0) MITREOriginal
- EU AI Act Article 53(1)(a) Obligations for providers of general-purpose AI modelsArticle 53(1)(a) and Annex XI European Union (EUR-Lex)Original
- EU AI Act Article 55(1)(a) Obligations of providers of general-purpose AI models with systemic riskArticle 55(1)(a) European Union (EUR-Lex)Original
- EU AI Act Article 9(1), 9(2)(a), 9(2)(d) Risk management systemArticle 9(1), 9(2)(a), 9(2)(d), read with Article 9(3) European Union (EUR-Lex)Original
- BSI R19 Vergiftung des Modells selbst (Model/Weight Poisoning) (Text, Bild, Video)Kap. 4, R19, p. 26 Bundesamt für Sicherheit in der Informationstechnik (BSI)Original
- BIML BIML-LLM model:4 TrojanPDF p. 17, [model:4:Trojan] Berryville Institute of Machine Learning (BIML)Original
Verwandte Bedrohungen
Weitere Einträge aus der Themengruppe Manipulation von Modell und Trainingsdaten.
Diese Bedrohung im eigenen System bewerten
Die Live-Demo enthält alle 52 Bedrohungen dieses Katalogs samt EU-AI-Act- und DSGVO-Einwertung. Die kostenlosen Einzelmodule decken KI-Risiko, EU-KI-VO und DSGVO ab. Ohne Registrierung; die Bewertung läuft lokal in Ihrem Browser.
Diesen Eintrag zitieren
Für Berichte, Richtlinien oder interne Unterlagen; der Link führt direkt auf diesen Eintrag.
„Sleepy Agent (zeit-/ereignisgetriggerte verdeckte Instruktionen)“. Versatile AI Risk Assessment, KI-Bedrohungskatalog, Stand Juli 2026. https://www.versatile-ai-risk-assessment.com/wissensbasis/bedrohungen/sleepy-agent/