Versatile AI Risk Assessment

KI-BedrohungskatalogManipulation von Modell und TrainingsdatenEntwicklung

Sleepy Agent (zeit-/ereignisgetriggerte verdeckte Instruktionen)

Im Modell schlummert verdeckte Schadlogik, die sich erst zeitversetzt aktiviert: an einem Stichtag, bei einem bestimmten Ereignis oder in einer bestimmten Umgebung. Bis dahin besteht das System alle Tests und Prüfungen unauffällig.

Stand: Juli 2026 · Katalogversion 2026.07.17.3 · 6 Gegenmaßnahmen · 12 belegte Quellen

Beschreibung

Ein Sleepy Agent (schlafende Schadlogik) ist eine Sonderform der Backdoor, der versteckten Hintertür im Modell: Die eingebettete Logik reagiert nicht auf ein vom Angreifer eingespeistes Sondermuster, sondern auf Bedingungen aus dem Einsatzkontext wie Datum, Nutzerprofil oder Merkmale der Betriebsumgebung. Solange die Bedingung nicht erfüllt ist, verhält sich das Modell völlig normal und durchläuft Abnahmetests, Sicherheitsprüfungen und Pilotphasen ohne Befund. Eingebracht wird die Logik über vergiftete Trainings- oder Feinabstimmungsdaten oder über manipulierte Modelle aus der Lieferkette. Forschung zeigt, dass solches Verhalten selbst zusätzliches Sicherheitstraining überstehen kann. Gerade die verzögerte, an Bedingungen geknüpfte Aktivierung macht die Bedrohung besonders schwer testbar.

Mögliche Auswirkung

Das Unternehmen nimmt ein scheinbar gründlich geprüftes System in Betrieb, dessen Verhalten sich später zu einem vom Angreifer gewählten Zeitpunkt ändert. Der Schaden trifft den laufenden Betrieb: falsche Ergebnisse, manipulierte Empfehlungen oder unerwünschte Aktionen, häufig an vielen Stellen gleichzeitig. Weil Abnahmetests und Audits zuvor fehlerfrei waren, ist der Vorfall schwer zuzuordnen und erschüttert das Vertrauen in Test- und Freigabeprozesse.

Beispiel

Ein zugekaufter KI-Assistent für die Softwareentwicklung liefert während der gesamten Pilotphase einwandfreie Vorschläge. Ab einem im Modell verankerten Stichtag baut er in Code für Produktivsysteme unauffällige Sicherheitslücken ein. Solches stichtagsgebundene Verhalten wurde in der Forschung gezielt erzeugt und untersucht.

Empfohlene Gegenmaßnahmen (6)

Jede Maßnahme nennt ihre Maßnahmenart, Wirkung, Umsetzungsebene und die Begründung der Einordnung.

Standard-Zuordnungen

Verifizierte Fundstellen in OWASP, NIST AI RMF, MITRE ATLAS, EU AI Act und weiteren Rahmenwerken. Die Zuordnungen sind taxonomisch, kein Konformitätsnachweis.

OWASP LLM Top 10 LLM04:2025NIST AI RMF Abschnitt 2.9 · MEASURE 2.7 · NISTAML.023 · NISTAML.051MITRE ATLAS AML.T0018 · AML.T0020EU AI Act Article 53(1)(a) · Article 55(1)(a) · Article 9(1), 9(2)(a), 9(2)(d)BSI R19BIML BIML-LLM model:4

Belegte Referenzen (12)

Jede Referenz nennt Rahmenwerk, Fundstelle und die herausgebende Organisation.

Weitere Einträge aus der Themengruppe Manipulation von Modell und Trainingsdaten.

Diese Bedrohung im eigenen System bewerten

Die Live-Demo enthält alle 52 Bedrohungen dieses Katalogs samt EU-AI-Act- und DSGVO-Einwertung. Die kostenlosen Einzelmodule decken KI-Risiko, EU-KI-VO und DSGVO ab. Ohne Registrierung; die Bewertung läuft lokal in Ihrem Browser.

Diesen Eintrag zitieren

Für Berichte, Richtlinien oder interne Unterlagen; der Link führt direkt auf diesen Eintrag.

„Sleepy Agent (zeit-/ereignisgetriggerte verdeckte Instruktionen)“. Versatile AI Risk Assessment, KI-Bedrohungskatalog, Stand Juli 2026.
https://www.versatile-ai-risk-assessment.com/wissensbasis/bedrohungen/sleepy-agent/

← Zurück zum vollständigen Katalog