KI-BedrohungskatalogAutonome KI und AgentenProduktion
Agenten-KI / Autonome Agenten
KI-Agenten planen mehrstufige Aufgaben selbstständig und führen sie mit Werkzeugen wie E-Mail, Datenbanken oder Codeausführung aus. Je weniger Menschen dabei mitwirken, desto weiter reichen Planungsfehler, manipulierte Inhalte und Folgefehler.
Beschreibung
Ein KI-Agent zerlegt einen Auftrag in Einzelschritte, ruft dafür selbstständig Werkzeuge und Schnittstellen auf und verarbeitet die Ergebnisse im nächsten Schritt weiter. In dieser Kette kumulieren mehrere Risiken: Planungs- und Bewertungsfehler setzen sich über die Schritte fort, und Angreifer können den Agenten über Inhalte umlenken, die er bei der Arbeit liest, etwa per Prompt Injection (versteckte Anweisungen in E-Mails, Dokumenten oder Webseiten). Ein umgelenkter oder fehlgeleiteter Agent nutzt dann seine legitimen Werkzeuge für schädliche Aktionen, führt Code aus oder leitet Daten nach außen. In Systemen aus mehreren Agenten kann sich ein einzelner Fehler kaskadenartig über weitere Agenten und Arbeitsabläufe ausbreiten.
Mögliche Auswirkung
Betroffen ist alles, was der Agent erreichen kann: Es drohen ungewollte Transaktionen, Datenabfluss, gelöschte Dateien und Ausfälle ganzer Abläufe. Kaskadeneffekte können den Schaden über das einzelne System hinaus ausweiten. Der EU AI Act verlangt für Hochrisiko-Systeme, dass Menschen wirksam beaufsichtigen, eingreifen und das System anhalten können; bei großen KI-Modellen mit allgemeinem Verwendungszweck nennt die Verordnung Autonomiegrad und Werkzeugzugriff als Faktoren systemischer Risiken.
Beispiel
Ein Entwicklungs-Agent mit Zugriff auf die Kommandozeile arbeitet Aufgaben aus Projektdateien ab. Eine präparierte Datei enthält versteckte Anweisungen, die der Agent als Auftrag versteht: Er führt einen Löschbefehl aus und vernichtet Daten auf dem System. Dabei bewegt er sich vollständig innerhalb seiner regulären Werkzeugrechte.
Empfohlene Gegenmaßnahmen (7)
Jede Maßnahme nennt ihre Maßnahmenart, Wirkung, Umsetzungsebene und die Begründung der Einordnung.
Strikte Scope-Begrenzung für Agenten-AktionenTechnisch
- Wirkung
- Präventiv, Schadensbegrenzend
- Umsetzungsebene
- Anwendung, API & Agenten
- Begründung der Einordnung
- „Strikte Scope-Begrenzung für Agenten-Aktionen“ ist primär technisch: Maschinell erzwungene Identitäts-, Berechtigungs- oder Bereichsregeln begrenzen unzulässige Zugriffe und Aktionen.
Menschliche Freigabe-Gates bei kritischen SchrittenOrganisatorisch & prozessual
- Wirkung
- Präventiv, Schadensbegrenzend
- Umsetzungsebene
- Anwendung, API & Agenten, Nutzung & Betrieb
- Ergänzende Maßnahmenart
- Mensch & Kompetenz, Technisch
- Begründung der Einordnung
- „Menschliche Freigabe-Gates bei kritischen Schritten“ ist primär organisatorisch & prozessual: Ein verbindliches Freigabe-Gate stoppt kritische Agentenaktionen vor der Ausführung; menschliches Urteil entscheidet über Freigabe oder Ablehnung.
Aktions-Budgets und Schritt-LimitsTechnisch
- Wirkung
- Präventiv, Schadensbegrenzend
- Umsetzungsebene
- Anwendung, API & Agenten
- Begründung der Einordnung
- „Aktions-Budgets und Schritt-Limits“ ist primär technisch: Automatisierte Ressourcensteuerung, Budget- oder Laufzeitgrenzen begrenzen Überlastung, Missbrauch, Kosten und Fehlerketten.
Umfassende Agenten-ObservabilityTechnisch
- Wirkung
- Aufdeckend
- Umsetzungsebene
- Anwendung, API & Agenten, Nutzung & Betrieb
- Begründung der Einordnung
- „Umfassende Agenten-Observability“ ist primär technisch: Software oder Analysewerkzeuge erzeugen und bewerten systematisch Messwerte, Abweichungen oder Angriffsindikatoren.
Reversible Operationen wo möglichTechnisch
- Wirkung
- Schadensbegrenzend, Wiederherstellend
- Umsetzungsebene
- Anwendung, API & Agenten, Nutzung & Betrieb
- Begründung der Einordnung
- „Reversible Operationen wo möglich“ ist primär technisch: Versionierte Zustände oder Rücksetzmechanismen ermöglichen eine kontrollierte Wiederherstellung.
Simulation / Dry-Run vor ProduktionTechnisch
- Wirkung
- Präventiv, Aufdeckend
- Umsetzungsebene
- Anwendung, API & Agenten, Nutzung & Betrieb
- Begründung der Einordnung
- „Simulation / Dry-Run vor Produktion“ ist primär technisch: Software oder Analysewerkzeuge erzeugen und bewerten systematisch Messwerte, Abweichungen oder Angriffsindikatoren.
Agenten-Security-SandboxingTechnisch
- Wirkung
- Präventiv, Schadensbegrenzend
- Umsetzungsebene
- Anwendung, API & Agenten, Infrastruktur
- Begründung der Einordnung
- „Agenten-Security-Sandboxing“ ist primär technisch: Architektur- und Laufzeitgrenzen trennen Daten, Ausführung oder Mandanten und begrenzen die Fehlerausbreitung.
Standard-Zuordnungen
Verifizierte Fundstellen in OWASP, NIST AI RMF, MITRE ATLAS, EU AI Act und weiteren Rahmenwerken. Die Zuordnungen sind taxonomisch, kein Konformitätsnachweis.
Belegte Referenzen (13)
Jede Referenz nennt Rahmenwerk, Fundstelle und die herausgebende Organisation.
- OWASP LLM Top 10 ASI01:2026 Agent Goal HijackASI01 Agent Goal Hijack, pp. 9–11 of the official PDF OWASP FoundationOriginal
- OWASP LLM Top 10 ASI02:2026 Tool Misuse and ExploitationASI02 Tool Misuse and Exploitation, pp. 12–14 of the official PDF OWASP FoundationOriginal
- OWASP LLM Top 10 ASI08:2026 Cascading FailuresASI08 Cascading Failures, pp. 30–32 of the official PDF OWASP FoundationOriginal
- OWASP LLM Top 10 LLM01:2025 Prompt InjectionLLM01:2025 Prompt Injection, official category page OWASP FoundationOriginal
- OWASP LLM Top 10 LLM06:2025 Excessive AgencyLLM06:2025 Excessive Agency, official category page OWASP FoundationOriginal
- NIST AI RMF Abschnitt 3.5 Security of AgentsAbschnitt 3.5, p. 54 National Institute of Standards and Technology (NIST)Original
- MITRE ATLAS AML.T0051 LLM Prompt InjectionATLAS.yaml technique object with id AML.T0051 (pinned release v5.6.0) MITREOriginal
- EU AI Act Article 14(4)(d) Human oversightArticle 14(4)(d); for automation bias, Article 14(4)(b) European Union (EUR-Lex)Original
- EU AI Act Article 26(5) Obligations of deployers of high-risk AI systemsArticle 26(5) European Union (EUR-Lex)Original
- EU AI Act Article 55(1)(a) Obligations of providers of general-purpose AI models with systemic riskArticle 55(1)(a) European Union (EUR-Lex)Original
- EU AI Act Article 9(1), 9(2)(a), 9(2)(d) Risk management systemArticle 9(1), 9(2)(a), 9(2)(d), read with Article 9(3) European Union (EUR-Lex)Original
- BSI R28 Indirect Prompt Injections (Text)Kap. 4, R28, p. 33 Bundesamt für Sicherheit in der Informationstechnik (BSI)Original
- BIML BIML78 system:5 Error PropagationPDF p. 25, [system:5:error propagation] Berryville Institute of Machine Learning (BIML)Original
Begriffe auf dieser Seite
Fachbegriffe aus dem Glossar, die in diesem Eintrag vorkommen. Jeder Verweis führt zur vollständigen Erklärung.
- Prompt Injection Manipulierte Eingaben oder eingeschleuste Inhalte steuern ein Sprachmodell um.
- Autonomiegrad Wie viel ein System ohne menschliches Zutun entscheidet und ausführt.
Verwandte Bedrohungen
Weitere Einträge aus der Themengruppe Autonome KI und Agenten.
Diese Bedrohung im eigenen System bewerten
Die Live-Demo enthält alle 52 Bedrohungen dieses Katalogs samt EU-AI-Act- und DSGVO-Einwertung. Die kostenlosen Einzelmodule decken KI-Risiko, EU-KI-VO und DSGVO ab. Ohne Registrierung; die Bewertung läuft lokal in Ihrem Browser.
Diesen Eintrag zitieren
Für Berichte, Richtlinien oder interne Unterlagen; der Link führt direkt auf diesen Eintrag.
„Agenten-KI / Autonome Agenten“. Versatile AI Risk Assessment, KI-Bedrohungskatalog, Stand Juli 2026. https://www.versatile-ai-risk-assessment.com/wissensbasis/bedrohungen/autonome-agenten/