Was ist Probabilistic Matching?

Probabilistic Matching – Definition

Probabilistic Matching ist ein Verfahren zur Identifizierung von Datensätzen, die sich wahrscheinlich auf dieselbe Person, Organisation oder Entität in der Realität beziehen. Es vergleicht mehrere Felder gleichzeitig und berechnet einen Score für die Übereinstimmungswahrscheinlichkeit. Anstatt exakte Werte vorauszusetzen, werden die Ähnlichkeiten der einzelnen Felder gewichtet und ihre Aussagekraft bewertet. Dies ermöglicht es, Matches trotz Tippfehlern, fehlender Werte oder unterschiedlicher Schreibweisen zu finden.

Wie funktioniert Probabilistic Matching?

Der Prozess folgt typischerweise vier Schritten:

  1. Felder vergleichen: Zwei Datensätze werden Feld für Feld miteinander verglichen – beispielsweise Name, Adresse, Geburtsdatum und Telefonnummer. Vergleiche erlauben oft kleine Abweichungen, sodass „Jon Smith" und „John Smith" als ähnlich gelten können.
  2. Gewichtungen zuweisen: Jedes Feld erhält eine Gewichtung basierend darauf, wie stark eine Übereinstimmung auf einen Match hindeutet. Übereinstimmung bei einem seltenen Nachnamen wird höher bewertet als bei einem häufigen Namen, und ein passender Steuernummer-Match zählt mehr als ein Stadt-Match.
  3. Match-Score berechnen: Die Gewichtungen werden zu einem einzigen Match-Score für das Datensatzpaar kombiniert.
  4. Nach Schwellenwerten sortieren: Paare oberhalb eines oberen Schwellenwerts werden als Matches behandelt, Paare unterhalb eines unteren Schwellenwerts als Nicht-Matches, und Paare dazwischen werden zur manuellen Überprüfung gekennzeichnet.

Sobald Matches bestätigt sind, werden die Datensätze typischerweise zu einer einzigen, vertrauenswürdigen Version zusammengeführt, oft als Golden Record bezeichnet.

Worin unterscheidet sich Probabilistic Matching von Deterministic Matching?

Deterministic Matching verwendet feste Regeln: Datensätze stimmen nur überein, wenn bestimmte Felder exakt gleich sind – beispielsweise die gleiche E-Mail-Adresse oder die gleiche Kundennummer. Es ist einfach, schnell und leicht zu erklären, verpasst aber Übereinstimmungen, wann immer Daten inkonsistent eingegeben werden.

Probabilistic Matching tauscht einen Teil dieser Einfachheit gegen Flexibilität ein. Es kann erkennen, dass „Acme Corp., 12 Main St." und „ACME Corporation, 12 Main Street" wahrscheinlich das gleiche Unternehmen sind, während starre Regeln diese als unterschiedlich behandeln würden. Viele Organisationen nutzen beide Verfahren: Deterministic-Regeln für eindeutige Fälle und Probabilistic Matching für alles Übrige.

Welche Risiken und Kompromisse gibt es?

  • Falsche Matches: Zwei verschiedene Personen oder Unternehmen können versehentlich zusammengeführt werden, wenn Schwellenwerte zu niedrig angesetzt sind – was schwer rückgängig zu machen ist.
  • Verpasste Matches: Zu hoch angesetzte Schwellenwerte belassen Duplikate im System.
  • Tuning-Aufwand: Gewichtungen und Schwellenwerte müssen für jeden Datensatz getestet und angepasst werden und erfordern Überprüfungen bei Datenänderungen.
  • Manuelle Überprüfung: Die Gruppe der „möglichen Matches" erfordert Entscheidungen durch Mitarbeiter; eine große Gruppe kann zu Rückstau führen.

Wo wird Probabilistic Matching eingesetzt?

Es wird überall dort eingesetzt, wo die gleiche Entität in mehreren Systemen oder Datensätzen ohne gemeinsame Kennung auftritt. Häufige Beispiele sind die Zusammenführung von Kundendatensätzen im Master Data Management (MDM), das Abgleichen von Patientendatensätzen über Krankenhäuser hinweg, das Verknüpfen von Lieferantendatensätzen nach einer Unternehmensfusion und das Entfernen von Duplikaten vor einer Datenmigration. Es ist eine der Kerntechniken hinter Match and Merge.