KI-BedrohungskatalogSchädliche InhalteProduktion
Hassrede und Diskriminierung
Das KI-System erzeugt Inhalte, die einzelne Personen oder Gruppen wegen geschützter Merkmale wie Herkunft, Geschlecht, Religion oder Behinderung herabsetzen oder zu deren Ausgrenzung aufrufen.
Beschreibung
Solche Ausgaben entstehen auf drei Wegen: auf direkte Aufforderung, durch einen Jailbreak (das gezielte Umgehen der im Modell verankerten Schutzmechanismen) oder unbeabsichtigt, weil das Modell Vorurteile und Verzerrungen (Bias) aus seinen Trainingsdaten übernimmt. Die Bandbreite reicht von stereotypisierenden Formulierungen über abwertende Sprache bis zu Aufrufen zu Hass oder Gewalt gegen eine Identitätsgruppe. Betroffen sind alle Kanäle, in denen das System frei formulierte Texte ausgibt, etwa Chatbots, Assistenzsysteme oder automatisch erzeugte Entscheidungen.
Mögliche Auswirkung
Für den Betreiber entstehen Reputationsschäden, rechtliche Risiken nach dem Allgemeinen Gleichbehandlungsgesetz (AGG) und aufsichtsrechtliche Folgen. Diskriminierende Ausgaben verletzen das Grundrecht auf Nichtdiskriminierung und schädigen die betroffenen Personen unmittelbar. In automatisierten Verfahren, etwa bei Bewerbungen, können benachteiligende Ergebnisse ganze Personengruppen systematisch ausschließen.
Beispiel
Ein Bewerbungs-Chatbot formuliert eine Absage in einer Weise, die Bewerberinnen aufgrund ihres Geschlechts abwertet, oder ein Kundenservice-Assistent gibt auf eine harmlose Frage eine stereotypisierende Antwort über eine ethnische Gruppe aus.
Empfohlene Gegenmaßnahmen (5)
Jede Maßnahme nennt ihre Maßnahmenart, Wirkung, Umsetzungsebene und die Begründung der Einordnung.
Content-Moderations-FilterTechnisch
- Wirkung
- Präventiv
- Umsetzungsebene
- Anwendung, API & Agenten
- Begründung der Einordnung
- „Content-Moderations-Filter“ ist primär technisch: Systemseitige Prüf-, Transformations- oder Blockierregeln stoppen oder neutralisieren unzulässige Inhalte vor der Weiterverarbeitung.
Bias-Testing und -EvaluierungTechnisch
- Wirkung
- Aufdeckend
- Umsetzungsebene
- Modell & Training, Nutzung & Betrieb
- Begründung der Einordnung
- „Bias-Testing und -Evaluierung“ ist primär technisch: Software oder Analysewerkzeuge erzeugen und bewerten systematisch Messwerte, Abweichungen oder Angriffsindikatoren.
Safety-Fine-Tuning (RLHF)Technisch
- Wirkung
- Präventiv
- Umsetzungsebene
- Modell & Training
- Begründung der Einordnung
- „Safety-Fine-Tuning (RLHF)“ ist primär technisch: Ein Modell-, Trainings- oder Datenverfahren verändert Systemverhalten oder Robustheit unmittelbar.
Nutzer-Feedback-MechanismenOrganisatorisch & prozessual
- Wirkung
- Aufdeckend
- Umsetzungsebene
- Anwendung, API & Agenten, Nutzung & Betrieb
- Ergänzende Maßnahmenart
- Technisch, Mensch & Kompetenz
- Begründung der Einordnung
- „Nutzer-Feedback-Mechanismen“ ist primär organisatorisch & prozessual: Ein definierter Melde-, Triage- und Bearbeitungsablauf überführt Hinweise in nachvollziehbare Folgeaktionen; ergänzt durch technische Umsetzung sowie Fachwissen und Urteil.
Diverse TrainingsdatenTechnisch
- Wirkung
- Präventiv
- Umsetzungsebene
- Daten, Modell & Training
- Begründung der Einordnung
- „Diverse Trainingsdaten“ ist primär technisch: Ein Modell-, Trainings- oder Datenverfahren verändert Systemverhalten oder Robustheit unmittelbar.
Standard-Zuordnungen
Verifizierte Fundstellen in OWASP, NIST AI RMF, MITRE ATLAS, EU AI Act und weiteren Rahmenwerken. Die Zuordnungen sind taxonomisch, kein Konformitätsnachweis.
Belegte Referenzen (9)
Jede Referenz nennt Rahmenwerk, Fundstelle und die herausgebende Organisation.
- OWASP LLM Top 10 LLM01:2025 Prompt InjectionLLM01:2025 Prompt Injection, official category page OWASP FoundationOriginal
- NIST AI RMF Abschnitt 2.3 Dangerous, Violent, or Hateful ContentAbschnitt 2.3, pp. 6–7 National Institute of Standards and Technology (NIST)Original
- NIST AI RMF Abschnitt 2.6 Harmful Bias and HomogenizationAbschnitt 2.6, pp. 8–9 National Institute of Standards and Technology (NIST)Original
- NIST AI RMF MEASURE 2.11 MEASURE 2.11MEASURE 2.11, p. 30 National Institute of Standards and Technology (NIST)Original
- MITRE ATLAS AML.T0048.002 Societal HarmATLAS.yaml technique object with id AML.T0048.002 (pinned release v5.6.0) MITREOriginal
- EU AI Act Article 55(1)(b) Obligations of providers of general-purpose AI models with systemic riskArticle 55(1)(b) European Union (EUR-Lex)Original
- BSI R5 Problematische und verzerrte Ausgaben (Text, Bild, Video)Kap. 4, R5, p. 16 Bundesamt für Sicherheit in der Informationstechnik (BSI)Original
- BIML BIML-LLM output:11 Black Box DiscriminationPDF p. 20, [output:11:black box discrimination] Berryville Institute of Machine Learning (BIML)Original
- BIML BIML78 system:1 Black Box DiscriminationPDF p. 25, [system:1:black box discrimination] Berryville Institute of Machine Learning (BIML)Original
Begriffe auf dieser Seite
Fachbegriffe aus dem Glossar, die in diesem Eintrag vorkommen. Jeder Verweis führt zur vollständigen Erklärung.
- Jailbreak Eingaben, die ein Modell dazu bringen, seine eigenen Schutzregeln zu übergehen.
- Feinabstimmung (Fine-Tuning) Ein vorhandenes Modell wird mit eigenen Daten weitertrainiert.
Verwandte Bedrohungen
Weitere Einträge aus der Themengruppe Schädliche Inhalte.
Diese Bedrohung im eigenen System bewerten
Die Live-Demo enthält alle 52 Bedrohungen dieses Katalogs samt EU-AI-Act- und DSGVO-Einwertung. Die kostenlosen Einzelmodule decken KI-Risiko, EU-KI-VO und DSGVO ab. Ohne Registrierung; die Bewertung läuft lokal in Ihrem Browser.
Diesen Eintrag zitieren
Für Berichte, Richtlinien oder interne Unterlagen; der Link führt direkt auf diesen Eintrag.
„Hassrede und Diskriminierung“. Versatile AI Risk Assessment, KI-Bedrohungskatalog, Stand Juli 2026. https://www.versatile-ai-risk-assessment.com/wissensbasis/bedrohungen/hassrede-und-diskriminierung/