Definition von Datenqualitätsdimensionen
Datenqualitätsdimensionen sind einzelne Merkmale, die verwendet werden, um zu beschreiben und zu messen, wie hochwertig ein Datensatz ist – beispielsweise ob er korrekt, vollständig und aktuell ist. Anstatt Datenqualität einfach als „gut" oder „schlecht" zu bewerten, unterteilen Dimensionen sie in spezifische Qualitätsaspekte auf, die jeweils separat überprüft, gemessen und verbessert werden können.
Welche sind die wichtigsten Datenqualitätsdimensionen?
Verschiedene Frameworks verwenden leicht unterschiedliche Listen, aber sechs Dimensionen erscheinen in den meisten davon:
- Genauigkeit: Die Daten beschreiben die reale Gegebenheit korrekt. Die gespeicherte Adresse eines Kunden ist die Adresse, unter der er tatsächlich lebt.
- Vollständigkeit: Alle erforderlichen Informationen sind vorhanden. Ein Produktdatensatz ohne Gewicht oder ohne Beschreibung ist unvollständig.
- Konsistenz: Dieselbe Information stimmt über Datensätze und Systeme hinweg überein. Ein Lieferant sollte nicht ein Bankkonto im ERP-System und ein anderes im Beschaffungstool haben.
- Aktualität: Die Daten sind aktuell und verfügbar, wenn sie benötigt werden. Eine Preisliste, die seit einem Jahr nicht aktualisiert wurde, erfüllt dieses Kriterium nicht, auch wenn sie damals korrekt war.
- Validität: Die Daten entsprechen dem erwarteten Format und den erwarteten Regeln. Daten sind echte Daten, E-Mail-Adressen enthalten ein „@", und Ländercodes stammen aus einer genehmigten Liste.
- Eindeutigkeit: Jede reale Entität wird nur einmal erfasst. Derselbe Kunde sollte nicht als drei separate Datensätze erscheinen.
Einige Frameworks fügen weitere hinzu, wie Integrität (Verknüpfungen zwischen Datensätzen sind intakt, beispielsweise bezieht sich jede Bestellung auf einen existierenden Kunden) und Relevanz (die Daten sind tatsächlich nützlich für ihren Zweck).
Warum sind Dimensionen nützlich?
Dimensionen geben Teams eine gemeinsame Sprache zur Beschreibung von Datenproblemen. Die Aussage „Kundendaten sind schlecht" zeigt keine Lösung auf, aber „Kundendaten sind zu 95 % vollständig, haben aber viele Duplikate" zeigt genau, wo der Fokus liegen sollte. Dimensionen helfen Organisationen auch dabei, klare Ziele zu setzen, Fortschritte über die Zeit zu verfolgen und die richtige Lösung auf das richtige Problem anzuwenden: Duplikate erfordern Deduplizierung, während veraltete Daten regelmäßige Aktualisierungen erfordern.
Wie werden Datenqualitätsdimensionen gemessen?
Jede Dimension wird normalerweise in eine oder mehrere messbare Regeln umgewandelt, wobei die Ergebnisse als Prozentsatz oder Anzahl ausgedrückt werden. Beispielsweise kann Vollständigkeit als der Anteil von Datensätzen mit allen erforderlichen ausgefüllten Feldern gemessen werden, und Eindeutigkeit als die Anzahl vermuteter Duplikate. Diese Überprüfungen werden oft durch Datenprofilierung durchgeführt, und die Ergebnisse werden häufig in einer Scorecard oder einem Dashboard zusammengefasst, das regelmäßig überprüft wird.
Einige Dimensionen sind schwieriger zu messen als andere. Validität kann automatisch gegen Formatregeln überprüft werden, aber Genauigkeit erfordert oft den Abgleich von Daten mit einer externen Quelle wie einer Postleitzahldatenbank oder die Bestätigung durch den Kunden oder Lieferanten.
Sind alle Dimensionen gleich wichtig?
Nein. Welche Dimensionen am wichtigsten sind, hängt davon ab, wie die Daten verwendet werden. Für eine Lieferadresse sind Genauigkeit und Aktualität entscheidend; für einen Finanzbericht können Konsistenz und Vollständigkeit wichtiger sein. Dimensionen können sich auch im Laufe der Zeit ändern: Daten, die bei ihrer Eingabe korrekt waren, können durch Datenverfall veralten. Daher wird die Qualität normalerweise kontinuierlich überwacht, anstatt nur einmal überprüft zu werden.