KI-BedrohungskatalogSchädliche InhalteProduktion
Selbstverletzung
Das KI-System ermutigt zu Selbstverletzung oder Suizid, gibt Anleitungen dazu oder stellt Mittel dafür bereit. Das Schadenspotenzial ist außerordentlich hoch.
Beschreibung
Besonders gefährlich sind solche Ausgaben bei Menschen in einer seelischen Krise und in Begleit- oder Chatbot-Anwendungen mit emotionaler Bindung. Sicherheitskonzepte unterscheiden bewusst zwischen der bloßen Darstellung, der Äußerung einer eigenen Absicht durch die nutzende Person und einer konkreten Anleitung, weil die richtige Schutzreaktion, etwa der Verweis auf Krisen-Hotlines statt einer reinen Ablehnung, davon abhängt. Auslöser können direkte Fragen, ein Jailbreak (das Umgehen der Schutzmechanismen) oder ein unpassender Gesprächsverlauf sein.
Mögliche Auswirkung
Im schwersten Fall können solche Ausgaben zum Tod von Menschen beitragen. Für den Betreiber folgen daraus höchste Haftungsrisiken und strenge regulatorische Anforderungen; die KI-Verordnung verlangt besonderen Schutz für Minderjährige und andere schutzbedürftige Personen.
Beispiel
Eine nutzende Person in einer Krise vertraut sich einem Begleit-Chatbot an, und dieser reagiert nicht mit dem Verweis auf professionelle Hilfe, sondern bestärkt selbstschädigendes Verhalten.
Empfohlene Gegenmaßnahmen (5)
Jede Maßnahme nennt ihre Maßnahmenart, Wirkung, Umsetzungsebene und die Begründung der Einordnung.
Spezialisierte Safety-Klassifikatoren für SelbstverletzungTechnisch
- Wirkung
- Aufdeckend
- Umsetzungsebene
- Modell & Training, Anwendung, API & Agenten
- Begründung der Einordnung
- „Spezialisierte Safety-Klassifikatoren für Selbstverletzung“ ist primär technisch: Software oder Analysewerkzeuge erzeugen und bewerten systematisch Messwerte, Abweichungen oder Angriffsindikatoren.
Verweis auf Krisen-Ressourcen (Hotlines)Technisch
- Wirkung
- Präventiv
- Umsetzungsebene
- Anwendung, API & Agenten, Nutzung & Betrieb
- Ergänzende Maßnahmenart
- Mensch & Kompetenz
- Begründung der Einordnung
- „Verweis auf Krisen-Ressourcen (Hotlines)“ ist primär technisch: Die Anwendung macht Unsicherheit, Systemgrenzen oder sichere nächste Schritte sichtbar und unterstützt informierte Entscheidungen; ergänzt durch Fachwissen und Urteil.
Verpflichtende, empathische AblehnungTechnisch
- Wirkung
- Präventiv
- Umsetzungsebene
- Modell & Training, Anwendung, API & Agenten
- Begründung der Einordnung
- „Verpflichtende, empathische Ablehnung“ ist primär technisch: Systemseitige Prüf-, Transformations- oder Blockierregeln stoppen oder neutralisieren unzulässige Inhalte vor der Weiterverarbeitung.
Kooperation mit Fachleuten für psychische GesundheitOrganisatorisch & prozessual
- Wirkung
- Präventiv
- Umsetzungsebene
- Organisation, Nutzung & Betrieb
- Ergänzende Maßnahmenart
- Mensch & Kompetenz
- Begründung der Einordnung
- „Kooperation mit Fachleuten für psychische Gesundheit“ ist primär organisatorisch & prozessual: Ein geregelter Beratungs- und Abstimmungsprozess bindet einschlägige Fachkompetenz in Gestaltung und Betrieb ein; ergänzt durch Fachwissen und Urteil.
Kontinuierliches Red-TeamingOrganisatorisch & prozessual
- Wirkung
- Aufdeckend
- Umsetzungsebene
- Modell & Training, Anwendung, API & Agenten, Nutzung & Betrieb
- Ergänzende Maßnahmenart
- Mensch & Kompetenz, Technisch
- Begründung der Einordnung
- „Kontinuierliches Red-Teaming“ ist primär organisatorisch & prozessual: Ein geplanter, wiederholbarer Prüfablauf mit Zuständigkeit und Nachverfolgung erzeugt die Schutzwirkung; ergänzt durch Fachwissen und Urteil sowie technische Umsetzung.
Standard-Zuordnungen
Verifizierte Fundstellen in OWASP, NIST AI RMF, MITRE ATLAS, EU AI Act und weiteren Rahmenwerken. Die Zuordnungen sind taxonomisch, kein Konformitätsnachweis.
Belegte Referenzen (4)
Jede Referenz nennt Rahmenwerk, Fundstelle und die herausgebende Organisation.
- OWASP LLM Top 10 LLM01:2025 Prompt InjectionLLM01:2025 Prompt Injection, official category page OWASP FoundationOriginal
- NIST AI RMF Abschnitt 2.3 Dangerous, Violent, or Hateful ContentAbschnitt 2.3, pp. 6–7 National Institute of Standards and Technology (NIST)Original
- MITRE ATLAS AML.T0048.002 Societal HarmATLAS.yaml technique object with id AML.T0048.002 (pinned release v5.6.0) MITREOriginal
- EU AI Act Article 55(1)(b) Obligations of providers of general-purpose AI models with systemic riskArticle 55(1)(b) European Union (EUR-Lex)Original
Begriffe auf dieser Seite
Fachbegriffe aus dem Glossar, die in diesem Eintrag vorkommen. Jeder Verweis führt zur vollständigen Erklärung.
- Jailbreak Eingaben, die ein Modell dazu bringen, seine eigenen Schutzregeln zu übergehen.
Verwandte Bedrohungen
Weitere Einträge aus der Themengruppe Schädliche Inhalte.
Diese Bedrohung im eigenen System bewerten
Die Live-Demo enthält alle 52 Bedrohungen dieses Katalogs samt EU-AI-Act- und DSGVO-Einwertung. Die kostenlosen Einzelmodule decken KI-Risiko, EU-KI-VO und DSGVO ab. Ohne Registrierung; die Bewertung läuft lokal in Ihrem Browser.
Diesen Eintrag zitieren
Für Berichte, Richtlinien oder interne Unterlagen; der Link führt direkt auf diesen Eintrag.
„Selbstverletzung“. Versatile AI Risk Assessment, KI-Bedrohungskatalog, Stand Juli 2026. https://www.versatile-ai-risk-assessment.com/wissensbasis/bedrohungen/selbstverletzung/