Was ist Datenbereinigung?

Definition Datenbereinigung

Datenbereinigung ist der Prozess der Erkennung und Korrektur von Fehlern, Inkonsistenzen und Ungenauigkeiten in einem Datensatz, um sicherzustellen, dass die Informationen zuverlässig und einsatzbereit sind. In der Praxis beantwortet sie Fragen wie: Sind Werte einheitlich formatiert, gibt es doppelte oder unvollständige Datensätze, und enthält jedes Feld die richtigen Informationen? Typische Aktivitäten umfassen das Beheben von Tippfehlern, die Standardisierung von Formaten, das Ergänzen fehlender Werte, das Entfernen von Duplikaten und die Korrektur von Datensätzen, die definierte Regeln verletzen.

Wie hängt Datenbereinigung mit PIM oder MDM zusammen?

Jedes PIM- und MDM-System ist auf saubere Daten angewiesen, um korrekt zu funktionieren. Bereinigung wandelt rohe, ungeordnete Eingaben aus mehreren Quellen in konsistente Datensätze um, denen vertraut werden kann und die geteilt werden können. Ohne sie breiten sich fehlerhafte Daten über verbundene Systeme aus und gefährden den Golden Record sowie die Qualität in jedem System, das diese Daten nutzt. Bereinigung arbeitet zusammen mit Datenqualität, Standardisierung und Deduplizierung – jede adressiert einen spezifischen Aspekt des Gesamtprozesses.

Was ist der Unterschied zwischen Datenbereinigung und Datenanreicherung?

Die Begriffe sind verwandt, aber unterschiedlich: Datenbereinigung korrigiert das, was bereits vorhanden ist, und entfernt Fehler und Inkonsistenzen, um bestehende Daten genau zu machen, während Datenanreicherung neue Informationen aus externen oder ergänzenden Quellen hinzufügt, um die Daten vollständiger zu machen. Bereinigung verbessert die Qualität; Anreicherung erhöht den Wert. Ein solider Datenprozess wendet normalerweise beide an – zunächst Bereinigung der Datensätze und dann Anreicherung.