KI-BedrohungskatalogAngriffe auf Modell und BetriebProduktion
Modell-Reconnaissance
Angreifer sammeln Informationen über ein produktives Modell, etwa Bauart, verwendete Modellfamilie und Fähigkeiten, um spätere gezieltere Angriffe vorzubereiten. Es ist die Auskundschaftungsphase vor Diebstahl oder Umgehung.
Beschreibung
Vor einem gezielten Angriff kundschaften Angreifer das eingesetzte Modell aus. Sie tasten über die normale Schnittstelle ab, welche Modellfamilie und Version dahintersteckt (Fingerprinting), welche Architektur vermutlich verwendet wird und welche Fähigkeiten und Ausgabekategorien das Modell hat. Dazu werten sie Antworten, mitgelieferte Metadaten, ausführliche Fehlermeldungen oder öffentlich zugängliche Artefakte aus. Die Auskundschaftung ist meist kein Selbstzweck, sondern die Vorstufe zu Modell-Diebstahl oder zu adversarialen Eingaben, die dann passgenau zugeschnitten werden.
Mögliche Auswirkung
Der unmittelbare Schaden ist gering, doch die gewonnenen Erkenntnisse machen Folgeangriffe deutlich wirksamer und schwerer abzuwehren. Wird die zugrunde liegende Modellfamilie erkannt, lassen sich bekannte Schwachstellen dieser Familie gezielt ausnutzen, zumal viele Dienste auf denselben Basismodellen aufbauen. Zugleich können interne Modell- und Konfigurationsdetails als Geschäftsgeheimnis abfließen.
Beispiel
Ein Angreifer schickt einem KI-Dienst eine Reihe systematischer Testfragen und wertet Formulierungen, Antwortzeiten und Fehlermeldungen aus. Daraus schließt er auf das verwendete Basismodell und richtet seinen nächsten Angriff gezielt auf dessen bekannte Schwächen aus.
Empfohlene Gegenmaßnahmen (6)
Jede Maßnahme nennt ihre Maßnahmenart, Wirkung, Umsetzungsebene und die Begründung der Einordnung.
Anomalie-Erkennung von AbfragemusternTechnisch
- Wirkung
- Aufdeckend
- Umsetzungsebene
- Anwendung, API & Agenten, Infrastruktur
- Begründung der Einordnung
- „Anomalie-Erkennung von Abfragemustern“ ist primär technisch: Software oder Analysewerkzeuge erzeugen und bewerten systematisch Messwerte, Abweichungen oder Angriffsindikatoren.
Ausgabe-Randomisierung gegen FingerprintingTechnisch
- Wirkung
- Präventiv
- Umsetzungsebene
- Anwendung, API & Agenten, Infrastruktur
- Begründung der Einordnung
- „Ausgabe-Randomisierung gegen Fingerprinting“ ist primär technisch: Minimierung, Randomisierung, gleichförmige Verarbeitung oder Abfragebegrenzung reduzieren den Informationsgewinn aus wiederholten Beobachtungen.
Minimierung von Modell-Metadaten in AntwortenTechnisch
- Wirkung
- Präventiv
- Umsetzungsebene
- Anwendung, API & Agenten, Infrastruktur
- Begründung der Einordnung
- „Minimierung von Modell-Metadaten in Antworten“ ist primär technisch: Minimierung, Randomisierung, gleichförmige Verarbeitung oder Abfragebegrenzung reduzieren den Informationsgewinn aus wiederholten Beobachtungen.
Rate-Limiting pro SessionTechnisch
- Wirkung
- Präventiv, Schadensbegrenzend
- Umsetzungsebene
- Anwendung, API & Agenten, Infrastruktur
- Ergänzende Maßnahmenart
- Organisatorisch & prozessual
- Begründung der Einordnung
- „Rate-Limiting pro Session“ ist primär technisch: Minimierung, Randomisierung, gleichförmige Verarbeitung oder Abfragebegrenzung reduzieren den Informationsgewinn aus wiederholten Beobachtungen; ergänzt durch verbindliche Abläufe.
Honeypot-Queries zur AngriffserkennungTechnisch
- Wirkung
- Aufdeckend
- Umsetzungsebene
- Anwendung, API & Agenten, Infrastruktur, Nutzung & Betrieb
- Begründung der Einordnung
- „Honeypot-Queries zur Angriffserkennung“ ist primär technisch: Software oder Analysewerkzeuge erzeugen und bewerten systematisch Messwerte, Abweichungen oder Angriffsindikatoren.
Zugriffskontrollen und AuthentifizierungTechnisch
- Wirkung
- Präventiv
- Umsetzungsebene
- Anwendung, API & Agenten, Infrastruktur
- Ergänzende Maßnahmenart
- Organisatorisch & prozessual
- Begründung der Einordnung
- „Zugriffskontrollen und Authentifizierung“ ist primär technisch: Maschinell erzwungene Identitäts-, Berechtigungs- oder Bereichsregeln begrenzen unzulässige Zugriffe und Aktionen; ergänzt durch verbindliche Abläufe.
Standard-Zuordnungen
Verifizierte Fundstellen in OWASP, NIST AI RMF, MITRE ATLAS, EU AI Act und weiteren Rahmenwerken. Die Zuordnungen sind taxonomisch, kein Konformitätsnachweis.
Belegte Referenzen (12)
Jede Referenz nennt Rahmenwerk, Fundstelle und die herausgebende Organisation.
- OWASP LLM Top 10 LLM02:2025 Sensitive Information DisclosureLLM02:2025 Sensitive Information Disclosure, official category page OWASP FoundationOriginal
- OWASP LLM Top 10 LLM10:2025 Unbounded ConsumptionLLM10:2025 Unbounded Consumption, official category page OWASP FoundationOriginal
- NIST AI RMF NISTAML.031 Model ExtractionTaxonomy Index, p. x; Abschnitt 2.4.4, pp. 31–32; Abschnitt 3.3.2, p. 47 National Institute of Standards and Technology (NIST)Original
- MITRE ATLAS AML.T0002 Acquire Public AI ArtifactsATLAS.yaml technique object with id AML.T0002 (pinned release v5.6.0) MITREOriginal
- MITRE ATLAS AML.T0014 Discover AI Model FamilyATLAS.yaml technique object with id AML.T0014 (pinned release v5.6.0) MITREOriginal
- MITRE ATLAS AML.T0040 AI Model Inference API AccessATLAS.yaml technique object with id AML.T0040 (pinned release v5.6.0) MITREOriginal
- EU AI Act Article 55(1)(d) Obligations of providers of general-purpose AI models with systemic riskArticle 55(1)(d) European Union (EUR-Lex)Original
- BSI R12 Wissenssammlung und -aufbereitung im Kontext krimineller Aktivitäten (Text, Bild)Kap. 4, R12, p. 20 Bundesamt für Sicherheit in der Informationstechnik (BSI)Original
- BSI R25 Extraktion von Kommunikationsdaten und hinterlegten Informationen (Text, Bild, Video)Kap. 4, R25, p. 30 Bundesamt für Sicherheit in der Informationstechnik (BSI)Original
- BIML BIML-LLM input:3 Open to the PublicPDF p. 16, [input:3:open to the public] Berryville Institute of Machine Learning (BIML)Original
- BIML BIML78 assembly:6 FilterPDF p. 13, [assembly:6:filter] Berryville Institute of Machine Learning (BIML)Original
- BIML BIML78 inference:3 Confidence ScoresPDF p. 20, [inference:3:confidence scores] Berryville Institute of Machine Learning (BIML)Original
Verwandte Bedrohungen
Weitere Einträge aus der Themengruppe Angriffe auf Modell und Betrieb.
Diese Bedrohung im eigenen System bewerten
Die Live-Demo enthält alle 52 Bedrohungen dieses Katalogs samt EU-AI-Act- und DSGVO-Einwertung. Die kostenlosen Einzelmodule decken KI-Risiko, EU-KI-VO und DSGVO ab. Ohne Registrierung; die Bewertung läuft lokal in Ihrem Browser.
Diesen Eintrag zitieren
Für Berichte, Richtlinien oder interne Unterlagen; der Link führt direkt auf diesen Eintrag.
„Modell-Reconnaissance“. Versatile AI Risk Assessment, KI-Bedrohungskatalog, Stand Juli 2026. https://www.versatile-ai-risk-assessment.com/wissensbasis/bedrohungen/modell-reconnaissance/