KI-BedrohungskatalogSchädliche InhalteProduktion
Gewalt / gefährliche Handlungen
Das KI-System stellt Gewalt dar, verherrlicht sie oder liefert Anleitungen für gefährliche Handlungen, etwa zum Bau von Waffen oder zu riskanten Do-it-yourself-Aktivitäten.
Beschreibung
Auf direkte Aufforderung oder nach Umgehung der Schutzmechanismen erzeugt das Modell Beschreibungen, Verherrlichung oder konkrete Handlungsanweisungen für Gewalttaten und gefährliche Aktivitäten. Die Bandbreite reicht von der Glorifizierung von Gewalt über Anleitungen zu Selbst- und Fremdgefährdung bis zu Informationen für den Bau von Waffen, im äußersten Fall einschließlich chemischer, biologischer, radiologischer oder nuklearer Kampf- und Gefahrstoffe (CBRN). Kernrisiko ist, dass das Modell die Kompetenz- und Aufwandsschwelle für Täter absenkt.
Mögliche Auswirkung
Aus solchen Ausgaben kann realer körperlicher Schaden entstehen, sowohl für einzelne Personen als auch, im Fall gefährlicher Stoffe, für die öffentliche Sicherheit. Für den Betreiber folgen daraus erhebliche rechtliche und aufsichtsrechtliche Risiken; bei besonders leistungsfähigen Modellen gilt dies als systemisches Risiko im Sinne der KI-Verordnung.
Beispiel
Ein Assistenzsystem beschreibt auf eine als Rollenspiel getarnte Anfrage Schritt für Schritt, wie eine gefährliche Substanz hergestellt wird, oder ein Chatbot verfasst einen Text, der eine Gewalttat verherrlicht.
Empfohlene Gegenmaßnahmen (5)
Jede Maßnahme nennt ihre Maßnahmenart, Wirkung, Umsetzungsebene und die Begründung der Einordnung.
Klassifikatoren für GewaltinhalteTechnisch
- Wirkung
- Aufdeckend
- Umsetzungsebene
- Anwendung, API & Agenten
- Begründung der Einordnung
- „Klassifikatoren für Gewaltinhalte“ ist primär technisch: Software oder Analysewerkzeuge erzeugen und bewerten systematisch Messwerte, Abweichungen oder Angriffsindikatoren.
Erkennung gefährlicher HandlungsanweisungenTechnisch
- Wirkung
- Aufdeckend
- Umsetzungsebene
- Anwendung, API & Agenten
- Begründung der Einordnung
- „Erkennung gefährlicher Handlungsanweisungen“ ist primär technisch: Software oder Analysewerkzeuge erzeugen und bewerten systematisch Messwerte, Abweichungen oder Angriffsindikatoren.
Safety-getunete ModelleTechnisch
- Wirkung
- Präventiv
- Umsetzungsebene
- Modell & Training
- Begründung der Einordnung
- „Safety-getunete Modelle“ ist primär technisch: Ein Modell-, Trainings- oder Datenverfahren verändert Systemverhalten oder Robustheit unmittelbar.
Ablehnungsmuster für schädliche AnfragenTechnisch
- Wirkung
- Präventiv
- Umsetzungsebene
- Modell & Training, Anwendung, API & Agenten
- Begründung der Einordnung
- „Ablehnungsmuster für schädliche Anfragen“ ist primär technisch: Systemseitige Prüf-, Transformations- oder Blockierregeln stoppen oder neutralisieren unzulässige Inhalte vor der Weiterverarbeitung.
Externes Meldewesen für schädliche InhalteOrganisatorisch & prozessual
- Wirkung
- Aufdeckend
- Umsetzungsebene
- Organisation, Nutzung & Betrieb
- Ergänzende Maßnahmenart
- Governance & Compliance
- Begründung der Einordnung
- „Externes Meldewesen für schädliche Inhalte“ ist primär organisatorisch & prozessual: Ein definierter Melde-, Triage- und Bearbeitungsablauf überführt Hinweise in nachvollziehbare Folgeaktionen; ergänzt durch Regeln und Aufsicht.
Standard-Zuordnungen
Verifizierte Fundstellen in OWASP, NIST AI RMF, MITRE ATLAS, EU AI Act und weiteren Rahmenwerken. Die Zuordnungen sind taxonomisch, kein Konformitätsnachweis.
Belegte Referenzen (5)
Jede Referenz nennt Rahmenwerk, Fundstelle und die herausgebende Organisation.
- OWASP LLM Top 10 LLM01:2025 Prompt InjectionLLM01:2025 Prompt Injection, official category page OWASP FoundationOriginal
- NIST AI RMF Abschnitt 2.3 Dangerous, Violent, or Hateful ContentAbschnitt 2.3, pp. 6–7 National Institute of Standards and Technology (NIST)Original
- MITRE ATLAS AML.T0048.002 Societal HarmATLAS.yaml technique object with id AML.T0048.002 (pinned release v5.6.0) MITREOriginal
- EU AI Act Article 55(1)(b) Obligations of providers of general-purpose AI models with systemic riskArticle 55(1)(b) European Union (EUR-Lex)Original
- BSI R5 Problematische und verzerrte Ausgaben (Text, Bild, Video)Kap. 4, R5, p. 16 Bundesamt für Sicherheit in der Informationstechnik (BSI)Original
Verwandte Bedrohungen
Weitere Einträge aus der Themengruppe Schädliche Inhalte.
Diese Bedrohung im eigenen System bewerten
Die Live-Demo enthält alle 52 Bedrohungen dieses Katalogs samt EU-AI-Act- und DSGVO-Einwertung. Die kostenlosen Einzelmodule decken KI-Risiko, EU-KI-VO und DSGVO ab. Ohne Registrierung; die Bewertung läuft lokal in Ihrem Browser.
Diesen Eintrag zitieren
Für Berichte, Richtlinien oder interne Unterlagen; der Link führt direkt auf diesen Eintrag.
„Gewalt / gefährliche Handlungen“. Versatile AI Risk Assessment, KI-Bedrohungskatalog, Stand Juli 2026. https://www.versatile-ai-risk-assessment.com/wissensbasis/bedrohungen/gewalt-und-gefaehrliche-handlungen/