KI-Entwicklung · Modul 1: KI-Grundlagen

Lektion 5 von 6Text 12 Min.

Daten: Qualität, Menge und Verzerrung

Lernziele
  • die Dimensionen der Datenqualität benennen
  • erklären, warum mehr Daten nicht automatisch bessere Modelle bedeuten
  • typische Formen von Verzerrung (Bias) erkennen
  • Maßnahmen für bessere Trainingsdaten ableiten

Ein Modell kann nur so gut sein wie die Daten, aus denen es lernt. In der Informatik heißt dieser Grundsatz Garbage in, garbage out. Diese Lektion zeigt, woran man gute Daten erkennt und wie Verzerrungen entstehen – eine der wichtigsten Fragen für den verantwortungsvollen Einsatz von KI.

1. Was gute Daten ausmacht

Tab. 5.1 Dimensionen der Datenqualität
DimensionLeitfrageBeispiel für ein Problem
VollständigkeitFehlen Werte oder ganze Fälle?Bei 30 % der Aufträge fehlt die Branche.
KorrektheitStimmen die Werte?Vertipper bei Beträgen, falsche Zuordnungen.
AktualitätBilden die Daten die heutige Lage ab?Preise von 2019 für ein Preismodell 2026.
KonsistenzSind Formate und Bedeutungen einheitlich?„Hamburg“, „HH“ und „Hambrg“ als drei Städte.
RepräsentativitätSpiegeln die Daten die Einsatzwirklichkeit?Kundendaten fast nur aus einer Region.
Label-QualitätSind die richtigen Antworten wirklich richtig?Uneinheitliche Einordnung durch verschiedene Bearbeiter.

2. Menge oder Qualität?

Große Datenmengen haben den Fortschritt der letzten Jahre ermöglicht. Für die meisten Unternehmensanwendungen gilt aber: Tausend saubere, passende Beispiele schlagen eine Million unpassende. Mehr Daten helfen nur, wenn sie die Aufgabe tatsächlich abbilden. Fehler in großen Datenmengen werden nicht herausgemittelt, wenn sie systematisch sind – sie werden mitgelernt.

3. Verzerrung (Bias)

Definition 5.1
Bias in Daten
Eine systematische Abweichung der Daten von der Wirklichkeit, die dazu führt, dass ein Modell bestimmte Fälle oder Gruppen dauerhaft schlechter oder anders behandelt.
Tab. 5.2 Häufige Formen von Verzerrung
FormEntstehungFolge
StichprobenverzerrungDie Daten stammen überwiegend aus einer Teilgruppe.Das Modell funktioniert für andere Gruppen schlechter.
Historische VerzerrungDie Daten spiegeln frühere, unfaire Entscheidungen.Das Modell setzt alte Muster fort.
MessverzerrungMerkmale werden je nach Gruppe unterschiedlich erfasst.Unterschiede entstehen durch die Erfassung, nicht durch die Sache.
Label-VerzerrungMenschliche Einordnungen sind uneinheitlich oder voreingenommen.Das Modell übernimmt die Vorurteile der Bewertenden.
Abb. 5.1Repräsentativität prüfen
Abb. 5.1: Repräsentativität prüfen. Fiktives Beispiel: In der Kundschaft sind 27, 33 und 40 Prozent in den drei Altersgruppen, in den Trainingsdaten 54, 34 und 12 Prozent. Die älteste Gruppe ist stark unterrepräsentiert.
Abb. 5.1Fiktives Beispiel: Ein Modell soll Kundenanfragen einordnen, die Trainingsdaten stammen aber überwiegend von jüngeren Kunden. Für die älteste Gruppe fehlen Beispiele – dort ist mit deutlich mehr Fehlern zu rechnen.

Wie ernst die Folgen sein können, zeigt ein viel zitiertes Beispiel: 2018 wurde bekannt, dass ein großer Onlinehändler ein experimentelles Werkzeug zur Bewerberauswahl eingestellt hatte. Es war mit Bewerbungen aus zehn Jahren trainiert worden, die überwiegend von Männern stammten, und bewertete Bewerbungen von Frauen systematisch schlechter.

4. Was hilft

  • Daten dokumentieren: Herkunft, Zeitraum, Zusammensetzung und bekannte Lücken festhalten – etwa in Form eines Datenblatts.
  • Getrennt auswerten: Die Genauigkeit nicht nur insgesamt, sondern für relevante Gruppen einzeln messen.
  • Gezielt ergänzen: Unterrepräsentierte Fälle nachsammeln statt einfach mehr vom Gleichen.
  • Menschen einbeziehen: Wo Entscheidungen Menschen betreffen, bleibt eine menschliche Prüfung unverzichtbar.
Für Hochrisiko-KI verlangt der EU AI Act in Art. 10 ausdrücklich Daten-Governance: geeignete, möglichst fehlerfreie und repräsentative Trainingsdaten sowie die Prüfung auf mögliche Verzerrungen. Mehr dazu im Kurs EU AI Act.

Übung

  1. Ein Modell zur Schadensprüfung wurde nur mit Fällen aus Süddeutschland trainiert. Welche Qualitätsdimension ist betroffen?
  2. Warum lösen „einfach mehr Daten“ eine historische Verzerrung nicht?
Lösungshinweise
  1. Repräsentativität – es liegt eine Stichprobenverzerrung vor.
  2. Weil zusätzliche Daten aus derselben Quelle dieselben früheren Entscheidungsmuster enthalten. Die Verzerrung wird dadurch eher verstärkt als ausgeglichen.
Quellen und weiterführende Literatur
  1. [1]Mehrabi, N. et al. (2021): A Survey on Bias and Fairness in Machine Learning. ACM Computing Surveys, 54(6).
  2. [2]Gebru, T. et al. (2021): Datasheets for Datasets. Communications of the ACM, 64(12).
  3. [3]Dastin, J. (2018): Amazon scraps secret AI recruiting tool that showed bias against women. Reuters, 10.10.2018.
  4. [4]Verordnung (EU) 2024/1689 (KI-Verordnung), Art. 10 Daten und Daten-Governance.

Stand: September 2026. Kursmaterial der Klarwerk Akademie – Abbildungen sind vereinfachte, schematische Darstellungen.

Kostenlos mitlernen

Lektion abhaken und das Wichtigste nie wieder vergessen.

  • Fortschritt je Kurs speichern
  • 4 Kernideen als Karteikarten
  • Teilnahme dokumentiert