KI-BedrohungskatalogLieferkette und HerkunftLieferkette
Lieferkette – Datensätze
Trainings- und Feinabstimmungsdaten aus fremden Quellen können vergiftet, fehlerhaft oder rechtlich belastet sein. Das Modell lernt diese Mängel mit; neben verzerrten oder schädlichen Ergebnissen drohen Urheberrechts- und Datenschutzverstöße.
Beschreibung
KI-Modelle lernen aus großen Datenmengen, die oft automatisiert aus dem Internet gesammelt (Crawling) oder von Dritten zugekauft werden, häufig ohne tiefere Integritätsprüfung. Angreifer nutzen das aus: Sie platzieren präparierte Inhalte in Quellen, die in Trainingsdaten einfließen, oder übernehmen abgelaufene Internet-Domains aus bekannten Datensatzlisten und ersetzen deren Inhalte. So gelangen vergiftete Daten in Training oder Fine-Tuning (die Feinabstimmung eines fertigen Modells) und verankern dort Verzerrungen, Falschinformationen oder versteckte Hintertüren. Daneben bergen fremde Datensätze rechtliche Risiken, etwa urheberrechtlich geschützte Inhalte oder unrechtmäßig erhobene personenbezogene Daten. Ist die Datenherkunft nicht dokumentiert, bleibt der Mangel oft lange unentdeckt.
Mögliche Auswirkung
Vergiftete oder mangelhafte Daten mindern Qualität und Zuverlässigkeit des Modells und können gezielt schädliches Verhalten verankern. Es drohen Urheberrechtsstreitigkeiten und DSGVO-Verstöße, wenn personenbezogene Daten ohne Rechtsgrundlage einfließen; das trifft auch die Personen hinter diesen Daten. Je nach Rolle und Risikoklasse verlangt der EU AI Act Schutz vor Datenvergiftung und Transparenz über Trainingsdaten. Hinzu kommen Bereinigungs- und Nachtrainingskosten sowie Reputationsschäden.
Beispiel
Ein Unternehmen kauft einen Branchendatensatz zu, um sein Modell für Kreditentscheidungen nachzutrainieren. Ein Teil der Daten stammt aus manipulierten Web-Quellen und enthält systematisch verzerrte Beispiele. Das Modell benachteiligt anschließend bestimmte Kundengruppen, ohne dass dies in Standardtests auffällt.
Empfohlene Gegenmaßnahmen (4)
Jede Maßnahme nennt ihre Maßnahmenart, Wirkung, Umsetzungsebene und die Begründung der Einordnung.
Vertrauenswürdige Datenquellen verwendenOrganisatorisch & prozessual
- Wirkung
- Präventiv
- Umsetzungsebene
- Daten, Lieferkette
- Ergänzende Maßnahmenart
- Technisch
- Begründung der Einordnung
- „Vertrauenswürdige Datenquellen verwenden“ ist primär organisatorisch & prozessual: Festgelegte Auswahl-, Betriebs- oder Lebenszyklusabläufe machen die Maßnahme verbindlich und wiederholbar; ergänzt durch technische Umsetzung.
Datenherkunft (Data Provenance) nachverfolgenTechnisch
- Wirkung
- Aufdeckend
- Umsetzungsebene
- Daten
- Ergänzende Maßnahmenart
- Organisatorisch & prozessual
- Begründung der Einordnung
- „Datenherkunft (Data Provenance) nachverfolgen“ ist primär technisch: Kryptografische oder maschinenprüfbare Merkmale sichern Vertraulichkeit, Integrität oder Herkunft; ergänzt durch verbindliche Abläufe.
Validierung und Integritätsprüfung der DatensätzeTechnisch
- Wirkung
- Präventiv, Aufdeckend
- Umsetzungsebene
- Daten
- Begründung der Einordnung
- „Validierung und Integritätsprüfung der Datensätze“ ist primär technisch: Software oder Analysewerkzeuge erzeugen und bewerten systematisch Messwerte, Abweichungen oder Angriffsindikatoren.
Lizenz- und Urheberrechts-Compliance-AuditsGovernance & Compliance
- Wirkung
- Aufdeckend
- Umsetzungsebene
- Daten, Lieferkette, Organisation
- Ergänzende Maßnahmenart
- Organisatorisch & prozessual
- Begründung der Einordnung
- „Lizenz- und Urheberrechts-Compliance-Audits“ ist primär der Maßnahmenart Governance & Compliance zugeordnet: Verbindliche Regeln, Kontrollziele oder Aufsicht bestimmen Zulässigkeit und Rechenschaft; ergänzt durch verbindliche Abläufe.
Standard-Zuordnungen
Verifizierte Fundstellen in OWASP, NIST AI RMF, MITRE ATLAS, EU AI Act und weiteren Rahmenwerken. Die Zuordnungen sind taxonomisch, kein Konformitätsnachweis.
Belegte Referenzen (16)
Jede Referenz nennt Rahmenwerk, Fundstelle und die herausgebende Organisation.
- OWASP LLM Top 10 LLM03:2025 Supply ChainLLM03:2025 Supply Chain, official category page OWASP FoundationOriginal
- NIST AI RMF Abschnitt 2.10 Intellectual PropertyAbschnitt 2.10, p. 11 National Institute of Standards and Technology (NIST)Original
- NIST AI RMF Abschnitt 2.12 Value Chain and Component IntegrationAbschnitt 2.12, p. 12 National Institute of Standards and Technology (NIST)Original
- NIST AI RMF MAP 4.1 MAP 4.1MAP 4.1, p. 27 National Institute of Standards and Technology (NIST)Original
- NIST AI RMF MEASURE 2.5 MEASURE 2.5MEASURE 2.5, p. 29 National Institute of Standards and Technology (NIST)Original
- NIST AI RMF NISTAML.05 Supply Chain AttacksTaxonomy Index, pp. x–xi; Abschnitt 3.2, pp. 41–43 National Institute of Standards and Technology (NIST)Original
- MITRE ATLAS AML.T0010 AI Supply Chain CompromiseATLAS.yaml technique object with id AML.T0010 (pinned release v5.6.0) MITREOriginal
- EU AI Act Article 25(4) Responsibilities along the AI value chainArticle 25(4) European Union (EUR-Lex)Original
- EU AI Act Article 53(1)(a) Obligations for providers of general-purpose AI modelsArticle 53(1)(a) and Annex XI European Union (EUR-Lex)Original
- EU AI Act Article 53(1)(d) Obligations for providers of general-purpose AI modelsArticle 53(1)(d) European Union (EUR-Lex)Original
- DSGVO Article 25(1)–(2) Data protection by design and by defaultArticle 25(1) and 25(2) European Union (EUR-Lex)Original
- DSGVO EDPB Opinion 28/2024, Sections 3.3–3.4.2 EDPB Opinion 28/2024 on certain data protection aspects related to the processing of personal data in the context of AI modelsSections 3.3–3.4 and Section 3.4.2, especially paragraphs 124–132, pp. 32–33 (unlawful development and downstream use) European Data Protection Board (EDPB)Original
- BSI R17 Vergiftung der Trainingsdaten (Data Poisoning) (Text, Bild, Video)Kap. 4, R17, p. 25 Bundesamt für Sicherheit in der Informationstechnik (BSI)Original
- BIML BIML-LLM LLMtop10:2 Data DebtPDF p. 12, [LLMtop10:2:data debt] Berryville Institute of Machine Learning (BIML)Original
- BIML BIML-LLM LLMtop10:6 Poison in the DataPDF p. 13, [LLMtop10:6:poison in the data] Berryville Institute of Machine Learning (BIML)Original
- BIML BIML78 raw:2 TrustworthinessPDF p. 10, [raw:2:trustworthiness] Berryville Institute of Machine Learning (BIML)Original
Begriffe auf dieser Seite
Fachbegriffe aus dem Glossar, die in diesem Eintrag vorkommen. Jeder Verweis führt zur vollständigen Erklärung.
- Feinabstimmung (Fine-Tuning) Ein vorhandenes Modell wird mit eigenen Daten weitertrainiert.
Verwandte Bedrohungen
Weitere Einträge aus der Themengruppe Lieferkette und Herkunft.
Diese Bedrohung im eigenen System bewerten
Die Live-Demo enthält alle 52 Bedrohungen dieses Katalogs samt EU-AI-Act- und DSGVO-Einwertung. Die kostenlosen Einzelmodule decken KI-Risiko, EU-KI-VO und DSGVO ab. Ohne Registrierung; die Bewertung läuft lokal in Ihrem Browser.
Diesen Eintrag zitieren
Für Berichte, Richtlinien oder interne Unterlagen; der Link führt direkt auf diesen Eintrag.
„Lieferkette – Datensätze“. Versatile AI Risk Assessment, KI-Bedrohungskatalog, Stand Juli 2026. https://www.versatile-ai-risk-assessment.com/wissensbasis/bedrohungen/lieferkette-datensaetze/