Was ist Deterministische Zuordnung?

Definition Deterministische Zuordnung

Deterministische Zuordnung ist eine Methode zur Identifikation von Datensätzen, die sich auf dieselbe Person, Organisation oder Entität in der Realität beziehen. Sie funktioniert durch die Anwendung fester Regeln, die exakte Übereinstimmungen in spezifischen Feldern erfordern. Eine Regel könnte beispielsweise vorsehen, dass zwei Kundendatensätze identisch sind, wenn ihre E-Mail-Adressen gleich sind. Das Ergebnis ist immer eindeutig: Datensätze erfüllen die Regel oder nicht.

Wie funktioniert deterministische Zuordnung?

Abgleichsregeln werden im Voraus definiert, üblicherweise auf eine von drei Arten:

  • Einzelner Identifikator: Datensätze stimmen überein, wenn sie einen eindeutigen Wert teilen, wie eine Steuernummer, Kundennummer, E-Mail-Adresse oder ein Produktbarcode.
  • Kombinierte Felder: Datensätze stimmen nur überein, wenn mehrere Felder identisch sind, etwa Nachname, Geburtsdatum und Postleitzahl zusammen.
  • Geordnete Regeln: Mehrere Regeln werden nacheinander überprüft, beginnend mit der zuverlässigsten. Teilen zwei Datensätze eine Steuernummer, stimmen sie überein; falls nicht, wird die nächste Regel versucht, beispielsweise der Abgleich von Firmennamen und Adresse.

Da der Vergleich exakt ist, hängen die Ergebnisse stark davon ab, wie konsistent die Daten eingegeben werden. Deshalb werden Datensätze üblicherweise vor dem Abgleich bereinigt und durch Datenstandardisierung in ein einheitliches Format gebracht – etwa durch das Entfernen von Leerzeichen und die einheitliche Formatierung aller Telefonnummern.

Welche Vorteile hat deterministische Zuordnung?

Deterministische Zuordnung ist einfach einzurichten, leicht zu erklären und läuft schnell ab, selbst bei großen Datenmengen. Jeder Abgleich lässt sich auf die Regel zurückverfolgen, die ihn erzeugt hat, was die Überprüfung und Prüfung der Ergebnisse erleichtert. Wenn ein zuverlässiger gemeinsamer Identifikator vorhanden ist, führt dies selten zu falschen Übereinstimmungen.

Welche Einschränkungen hat sie?

  • Verpasste Übereinstimmungen: Kleine Unterschiede wie Tippfehler, Abkürzungen oder fehlende Werte verhindern einen Abgleich, sodass „Acme Corp." und „Acme Corporation" als unterschiedliche Unternehmen behandelt werden.
  • Gemeinsame Identifikatoren: Werte, die eindeutig zu sein scheinen, sind es manchmal nicht – etwa eine gemeinsame Familien-E-Mail-Adresse oder die Haupttelefonnummer eines Unternehmens –, was zu falschen Übereinstimmungen führen kann.
  • Wachsende Regelmengen: Um mehr Situationen abzudecken, sind mehr Regeln erforderlich, die im Laufe der Zeit schwerer zu warten werden.

Wie unterscheidet sich deterministische von probabilistischer Zuordnung?

Probabilistische Zuordnung vergleicht mehrere Felder, erlaubt Näherungstreffer und berechnet eine Wahrscheinlichkeit dafür, dass zwei Datensätze identisch sind. Sie findet mehr Übereinstimmungen in ungeordneten Daten, erfordert aber mehr Feinabstimmung und erzeugt einige unsichere Fälle, die einer Überprüfung bedürfen. Deterministische Zuordnung ist die bessere Wahl, wenn die Daten sauber und zuverlässige Identifikatoren vorhanden sind. Viele Organisationen kombinieren beide Methoden in einem Match-and-Merge-Prozess und nutzen deterministische Regeln für eindeutige Fälle sowie probabilistische Zuordnung für den Rest.