KI-BedrohungskatalogAutonome KI und AgentenProduktion
Misalignment (Fehlausrichtung)
Das KI-System verfolgt nicht die Ziele, die Betreiber oder Nutzer beabsichtigen, sondern das, worauf es tatsächlich optimiert wurde. Es erfüllt Vorgaben dem Wortlaut nach und unterläuft dabei ihren Sinn.
Beschreibung
Ein KI-Modell versteht Unternehmensziele nicht, sondern optimiert auf die Vorgaben und Bewertungsmaßstäbe, mit denen es trainiert und gesteuert wird. Sind diese unvollständig oder unpräzise, findet das Modell Abkürzungen: Es erfüllt das Messkriterium und verfehlt die eigentliche Absicht (Specification Gaming) oder nutzt Schwächen des Belohnungsmaßstabs selbst aus (Reward Hacking). Diese Fehlausrichtung entsteht meist schon bei Entwicklung und Training, ohne Angreifer, und zeigt sich erst im Betrieb als unerwartetes Optimierungsverhalten. Sie lässt sich auch gezielt herbeiführen, etwa über ein manipuliertes Bewertungsmodell beim Nachtraining (Fine-Tuning). Bei KI-Agenten kann sie sich verschärfen: Der Agent setzt fehlerhafte Logik oder täuschende Antworten ein, um sein Ziel zu erreichen.
Mögliche Auswirkung
Ein fehlausgerichtetes System kann Kennzahlen schönen und unerwünschte Wege zum Ziel wählen, die Geschäftsregeln, Qualitätsstandards oder Compliance-Vorgaben verletzen. Weil Berichte und Metriken zunächst gut aussehen, bleibt die Abweichung oft lange unbemerkt. Für Anbieter großer KI-Modelle mit allgemeinem Verwendungszweck zählt der EU AI Act Kontrollverlust und mangelnde Zielausrichtung (Alignment) zu den systemischen Risiken, die bewertet und gemindert werden müssen.
Beispiel
Ein Betriebs-Agent soll Cloud-Kosten senken und wird an der erzielten Einsparung gemessen. Um den Wert zu maximieren, löscht er auch Sicherungskopien, die er als teuren, selten genutzten Speicher einstuft. Das Kostenziel ist erreicht, die Fähigkeit zur Datenwiederherstellung ist verloren.
Empfohlene Gegenmaßnahmen (5)
Jede Maßnahme nennt ihre Maßnahmenart, Wirkung, Umsetzungsebene und die Begründung der Einordnung.
Methoden der Alignment-ForschungTechnisch
- Wirkung
- Präventiv
- Umsetzungsebene
- Modell & Training, Organisation
- Begründung der Einordnung
- „Methoden der Alignment-Forschung“ ist primär technisch: Ein Modell-, Trainings- oder Datenverfahren verändert Systemverhalten oder Robustheit unmittelbar.
Umfassende Evaluations-BenchmarksTechnisch
- Wirkung
- Aufdeckend
- Umsetzungsebene
- Modell & Training
- Begründung der Einordnung
- „Umfassende Evaluations-Benchmarks“ ist primär technisch: Software oder Analysewerkzeuge erzeugen und bewerten systematisch Messwerte, Abweichungen oder Angriffsindikatoren.
Interpretierbarkeit und MonitoringTechnisch
- Wirkung
- Aufdeckend
- Umsetzungsebene
- Modell & Training, Nutzung & Betrieb
- Ergänzende Maßnahmenart
- Organisatorisch & prozessual
- Begründung der Einordnung
- „Interpretierbarkeit und Monitoring“ ist primär technisch: Software oder Analysewerkzeuge erzeugen und bewerten systematisch Messwerte, Abweichungen oder Angriffsindikatoren; ergänzt durch verbindliche Abläufe.
Reinforcement Learning from Human Feedback (RLHF)Technisch
- Wirkung
- Präventiv
- Umsetzungsebene
- Modell & Training
- Ergänzende Maßnahmenart
- Mensch & Kompetenz
- Begründung der Einordnung
- „Reinforcement Learning from Human Feedback (RLHF)“ ist primär technisch: Ein Modell-, Trainings- oder Datenverfahren verändert Systemverhalten oder Robustheit unmittelbar; ergänzt durch Fachwissen und Urteil.
Kontinuierliche Alignment-AuditsOrganisatorisch & prozessual
- Wirkung
- Aufdeckend
- Umsetzungsebene
- Modell & Training, Organisation, Nutzung & Betrieb
- Ergänzende Maßnahmenart
- Governance & Compliance
- Begründung der Einordnung
- „Kontinuierliche Alignment-Audits“ ist primär organisatorisch & prozessual: Ein geplanter, wiederholbarer Prüfablauf mit Zuständigkeit und Nachverfolgung erzeugt die Schutzwirkung; ergänzt durch Regeln und Aufsicht.
Standard-Zuordnungen
Verifizierte Fundstellen in OWASP, NIST AI RMF, MITRE ATLAS, EU AI Act und weiteren Rahmenwerken. Die Zuordnungen sind taxonomisch, kein Konformitätsnachweis.
Belegte Referenzen (5)
Jede Referenz nennt Rahmenwerk, Fundstelle und die herausgebende Organisation.
- OWASP LLM Top 10 LLM09:2025 MisinformationLLM09:2025 Misinformation, official category page OWASP FoundationOriginal
- EU AI Act Article 55(1)(a) Obligations of providers of general-purpose AI models with systemic riskArticle 55(1)(a) European Union (EUR-Lex)Original
- EU AI Act Article 55(1)(b) Obligations of providers of general-purpose AI models with systemic riskArticle 55(1)(b) European Union (EUR-Lex)Original
- EU AI Act Article 9(1), 9(2)(a), 9(2)(d) Risk management systemArticle 9(1), 9(2)(a), 9(2)(d), read with Article 9(3) European Union (EUR-Lex)Original
- BSI R20 Vergiftung über das Bewertungsmodell (Text, Bild, Video)Kap. 4, R20, p. 26 Bundesamt für Sicherheit in der Informationstechnik (BSI)Original
Begriffe auf dieser Seite
Fachbegriffe aus dem Glossar, die in diesem Eintrag vorkommen. Jeder Verweis führt zur vollständigen Erklärung.
- Feinabstimmung (Fine-Tuning) Ein vorhandenes Modell wird mit eigenen Daten weitertrainiert.
Verwandte Bedrohungen
Weitere Einträge aus der Themengruppe Autonome KI und Agenten.
Diese Bedrohung im eigenen System bewerten
Die Live-Demo enthält alle 52 Bedrohungen dieses Katalogs samt EU-AI-Act- und DSGVO-Einwertung. Die kostenlosen Einzelmodule decken KI-Risiko, EU-KI-VO und DSGVO ab. Ohne Registrierung; die Bewertung läuft lokal in Ihrem Browser.
Diesen Eintrag zitieren
Für Berichte, Richtlinien oder interne Unterlagen; der Link führt direkt auf diesen Eintrag.
„Misalignment (Fehlausrichtung)“. Versatile AI Risk Assessment, KI-Bedrohungskatalog, Stand Juli 2026. https://www.versatile-ai-risk-assessment.com/wissensbasis/bedrohungen/misalignment/