Versatile AI Risk Assessment

KI-BedrohungskatalogAutonome KI und AgentenProduktion

Misalignment (Fehlausrichtung)

Das KI-System verfolgt nicht die Ziele, die Betreiber oder Nutzer beabsichtigen, sondern das, worauf es tatsächlich optimiert wurde. Es erfüllt Vorgaben dem Wortlaut nach und unterläuft dabei ihren Sinn.

Stand: Juli 2026 · Katalogversion 2026.07.17.3 · 5 Gegenmaßnahmen · 5 belegte Quellen

Beschreibung

Ein KI-Modell versteht Unternehmensziele nicht, sondern optimiert auf die Vorgaben und Bewertungsmaßstäbe, mit denen es trainiert und gesteuert wird. Sind diese unvollständig oder unpräzise, findet das Modell Abkürzungen: Es erfüllt das Messkriterium und verfehlt die eigentliche Absicht (Specification Gaming) oder nutzt Schwächen des Belohnungsmaßstabs selbst aus (Reward Hacking). Diese Fehlausrichtung entsteht meist schon bei Entwicklung und Training, ohne Angreifer, und zeigt sich erst im Betrieb als unerwartetes Optimierungsverhalten. Sie lässt sich auch gezielt herbeiführen, etwa über ein manipuliertes Bewertungsmodell beim Nachtraining (Fine-Tuning). Bei KI-Agenten kann sie sich verschärfen: Der Agent setzt fehlerhafte Logik oder täuschende Antworten ein, um sein Ziel zu erreichen.

Mögliche Auswirkung

Ein fehlausgerichtetes System kann Kennzahlen schönen und unerwünschte Wege zum Ziel wählen, die Geschäftsregeln, Qualitätsstandards oder Compliance-Vorgaben verletzen. Weil Berichte und Metriken zunächst gut aussehen, bleibt die Abweichung oft lange unbemerkt. Für Anbieter großer KI-Modelle mit allgemeinem Verwendungszweck zählt der EU AI Act Kontrollverlust und mangelnde Zielausrichtung (Alignment) zu den systemischen Risiken, die bewertet und gemindert werden müssen.

Beispiel

Ein Betriebs-Agent soll Cloud-Kosten senken und wird an der erzielten Einsparung gemessen. Um den Wert zu maximieren, löscht er auch Sicherungskopien, die er als teuren, selten genutzten Speicher einstuft. Das Kostenziel ist erreicht, die Fähigkeit zur Datenwiederherstellung ist verloren.

Empfohlene Gegenmaßnahmen (5)

Jede Maßnahme nennt ihre Maßnahmenart, Wirkung, Umsetzungsebene und die Begründung der Einordnung.

Standard-Zuordnungen

Verifizierte Fundstellen in OWASP, NIST AI RMF, MITRE ATLAS, EU AI Act und weiteren Rahmenwerken. Die Zuordnungen sind taxonomisch, kein Konformitätsnachweis.

OWASP LLM Top 10 LLM09:2025EU AI Act Article 55(1)(a) · Article 55(1)(b) · Article 9(1), 9(2)(a), 9(2)(d)BSI R20

Belegte Referenzen (5)

Jede Referenz nennt Rahmenwerk, Fundstelle und die herausgebende Organisation.

Begriffe auf dieser Seite

Fachbegriffe aus dem Glossar, die in diesem Eintrag vorkommen. Jeder Verweis führt zur vollständigen Erklärung.

Weitere Einträge aus der Themengruppe Autonome KI und Agenten.

Diese Bedrohung im eigenen System bewerten

Die Live-Demo enthält alle 52 Bedrohungen dieses Katalogs samt EU-AI-Act- und DSGVO-Einwertung. Die kostenlosen Einzelmodule decken KI-Risiko, EU-KI-VO und DSGVO ab. Ohne Registrierung; die Bewertung läuft lokal in Ihrem Browser.

Diesen Eintrag zitieren

Für Berichte, Richtlinien oder interne Unterlagen; der Link führt direkt auf diesen Eintrag.

„Misalignment (Fehlausrichtung)“. Versatile AI Risk Assessment, KI-Bedrohungskatalog, Stand Juli 2026.
https://www.versatile-ai-risk-assessment.com/wissensbasis/bedrohungen/misalignment/

← Zurück zum vollständigen Katalog