KI-BedrohungskatalogPrompt-Angriffe und Umgehung von SchutzmechanismenProduktion
Prompt Injection – Indirekt
Bösartige Anweisungen stecken versteckt in externen Inhalten wie Dokumenten, Webseiten oder E-Mails. Verarbeitet das KI-System diesen Inhalt im normalen Betrieb, führt es die versteckten Befehle unbemerkt mit aus.
Beschreibung
Bei der indirekten Prompt Injection stammt die Manipulation nicht von der nutzenden Person, sondern von Dritten, die präparierte Inhalte platzieren. Angreifer tarnen die Anweisungen, etwa als weiße Schrift auf weißem Grund, in Schriftgröße Null oder in einem Video-Transkript. Ruft das Modell solche Quellen ab, zum Beispiel beim Zusammenfassen einer Webseite oder in einem RAG-System (Retrieval Augmented Generation), das zur Beantwortung von Fragen externe Dokumente heranzieht, behandelt es den versteckten Text als Anweisung. Betroffen ist meist die Person, die dem System vertraut, nicht der Angreifer selbst.
Mögliche Auswirkung
Das System kann Zusammenfassungen verfälschen, Nutzende auf schädliche Links lenken oder vertrauliche Daten an eine fremde Adresse ausleiten, etwa durch das Nachladen externer Bilder. In verbundenen Systemen können versteckte Befehle E-Mails aus dem Postfach des Opfers versenden oder weitere Aktionen anstoßen. Das schädigt Datenschutz, Betrieb und Vertrauen.
Beispiel
Eine Mitarbeiterin lässt sich vom KI-System eine eingegangene E-Mail zusammenfassen. In der Nachricht steht unsichtbarer Text, der das System anweist, den bisherigen Chatverlauf an eine externe Adresse zu schicken. Das System befolgt die versteckte Anweisung, ohne dass es jemand merkt.
Empfohlene Gegenmaßnahmen (5)
Jede Maßnahme nennt ihre Maßnahmenart, Wirkung, Umsetzungsebene und die Begründung der Einordnung.
Validierung der InhaltsquellenTechnisch
- Wirkung
- Präventiv
- Umsetzungsebene
- Daten, Anwendung, API & Agenten
- Begründung der Einordnung
- „Validierung der Inhaltsquellen“ ist primär technisch: Systemseitige Prüf-, Transformations- oder Blockierregeln stoppen oder neutralisieren unzulässige Inhalte vor der Weiterverarbeitung.
Sandbox-Verarbeitung externer InhalteTechnisch
- Wirkung
- Präventiv, Schadensbegrenzend
- Umsetzungsebene
- Anwendung, API & Agenten, Infrastruktur
- Begründung der Einordnung
- „Sandbox-Verarbeitung externer Inhalte“ ist primär technisch: Architektur- und Laufzeitgrenzen trennen Daten, Ausführung oder Mandanten und begrenzen die Fehlerausbreitung.
Ausgabe-Filterung und -ReviewTechnisch
- Wirkung
- Präventiv
- Umsetzungsebene
- Anwendung, API & Agenten
- Ergänzende Maßnahmenart
- Organisatorisch & prozessual
- Begründung der Einordnung
- „Ausgabe-Filterung und -Review“ ist primär technisch: Systemseitige Prüf-, Transformations- oder Blockierregeln stoppen oder neutralisieren unzulässige Inhalte vor der Weiterverarbeitung; ergänzt durch verbindliche Abläufe.
Tool-Zugriff in RAG-Kontexten einschränkenTechnisch
- Wirkung
- Präventiv
- Umsetzungsebene
- Anwendung, API & Agenten
- Ergänzende Maßnahmenart
- Organisatorisch & prozessual
- Begründung der Einordnung
- „Tool-Zugriff in RAG-Kontexten einschränken“ ist primär technisch: Maschinell erzwungene Identitäts-, Berechtigungs- oder Bereichsregeln begrenzen unzulässige Zugriffe und Aktionen; ergänzt durch verbindliche Abläufe.
Provenienz-Tracking für abgerufene InhalteTechnisch
- Wirkung
- Aufdeckend
- Umsetzungsebene
- Daten, Anwendung, API & Agenten
- Ergänzende Maßnahmenart
- Organisatorisch & prozessual
- Begründung der Einordnung
- „Provenienz-Tracking für abgerufene Inhalte“ ist primär technisch: Kryptografische oder maschinenprüfbare Merkmale sichern Vertraulichkeit, Integrität oder Herkunft; ergänzt durch verbindliche Abläufe.
Standard-Zuordnungen
Verifizierte Fundstellen in OWASP, NIST AI RMF, MITRE ATLAS, EU AI Act und weiteren Rahmenwerken. Die Zuordnungen sind taxonomisch, kein Konformitätsnachweis.
Belegte Referenzen (12)
Jede Referenz nennt Rahmenwerk, Fundstelle und die herausgebende Organisation.
- OWASP LLM Top 10 LLM01:2025 Prompt InjectionLLM01:2025 Prompt Injection, official category page OWASP FoundationOriginal
- NIST AI RMF Abschnitt 2.9 Information SecurityAbschnitt 2.9, pp. 10–11 National Institute of Standards and Technology (NIST)Original
- NIST AI RMF NISTAML.015 Indirect Prompt InjectionTaxonomy Index, pp. x–xi; Abschnitt 3.4, pp. 50–53; Glossary, p. 110 National Institute of Standards and Technology (NIST)Original
- MITRE ATLAS AML.T0051.001 IndirectATLAS.yaml technique object with id AML.T0051.001 (pinned release v5.6.0) MITREOriginal
- EU AI Act Article 14(4)(d) Human oversightArticle 14(4)(d); for automation bias, Article 14(4)(b) European Union (EUR-Lex)Original
- EU AI Act Article 55(1)(a) Obligations of providers of general-purpose AI models with systemic riskArticle 55(1)(a) European Union (EUR-Lex)Original
- BSI R28 Indirect Prompt Injections (Text)Kap. 4, R28, p. 33 Bundesamt für Sicherheit in der Informationstechnik (BSI)Original
- BSI R3 Fehlerhafte Reaktion auf Eingaben (Text, Bild, Video)Kap. 4, R3, p. 14 Bundesamt für Sicherheit in der Informationstechnik (BSI)Original
- BSI R7 Fehlende Reproduzierbarkeit und Erklärbarkeit (Text, Bild, Video)Kap. 4, R7, p. 17 Bundesamt für Sicherheit in der Informationstechnik (BSI)Original
- BIML BIML-LLM input:2 Prompt InjectionPDF p. 16, [input:2:prompt injection] Berryville Institute of Machine Learning (BIML)Original
- BIML BIML-LLM LLMtop10:5 Prompt ManipulationPDF p. 13, [LLMtop10:5:prompt manipulation] Berryville Institute of Machine Learning (BIML)Original
- BIML BIML-LLM raw:10 Query DataPDF p. 15, [raw:10:query data] Berryville Institute of Machine Learning (BIML)Original
Begriffe auf dieser Seite
Fachbegriffe aus dem Glossar, die in diesem Eintrag vorkommen. Jeder Verweis führt zur vollständigen Erklärung.
- Prompt Injection Manipulierte Eingaben oder eingeschleuste Inhalte steuern ein Sprachmodell um.
- RAG (Retrieval Augmented Generation) Das Modell zieht vor der Antwort passende Dokumente aus einer eigenen Wissensbasis.
Verwandte Bedrohungen
Weitere Einträge aus der Themengruppe Prompt-Angriffe und Umgehung von Schutzmechanismen.
Diese Bedrohung im eigenen System bewerten
Die Live-Demo enthält alle 52 Bedrohungen dieses Katalogs samt EU-AI-Act- und DSGVO-Einwertung. Die kostenlosen Einzelmodule decken KI-Risiko, EU-KI-VO und DSGVO ab. Ohne Registrierung; die Bewertung läuft lokal in Ihrem Browser.
Diesen Eintrag zitieren
Für Berichte, Richtlinien oder interne Unterlagen; der Link führt direkt auf diesen Eintrag.
„Prompt Injection – Indirekt“. Versatile AI Risk Assessment, KI-Bedrohungskatalog, Stand Juli 2026. https://www.versatile-ai-risk-assessment.com/wissensbasis/bedrohungen/prompt-injection-indirekt/