Match and Merge Definition
Match and Merge ist die zweistufige Technik zur Identifikation von Datensätzen, die dieselbe reale Entität beschreiben, und deren Zusammenführung in einen konsolidierten Datensatz. Matching findet die über Systeme verteilten Duplikate, und Merging verschmilzt sie zu einer einzigen Version, wobei für jedes Attribut der beste verfügbare Wert beibehalten wird. Es ist der Kernmechanismus zur Erstellung eines Golden Record.
Wie funktioniert Match and Merge?
Matching vergleicht Datensätze, um festzustellen, ob sie sich auf dasselbe Produkt, denselben Lieferanten oder denselben Kunden beziehen. Dies kann auf exakte Übereinstimmungen (identische Kennzeichner wie GTIN oder Steuernummer) oder auf Fuzzy-Logik basieren, die Schreibfehler, Abkürzungen und Formatierungsabweichungen toleriert und bewertet, wie wahrscheinlich zwei Datensätze identisch sind. Sobald eine Gruppe übereinstimmender Datensätze bestätigt ist, werden diese beim Merging zusammengeführt. Da Quellen sich oft widersprechen, entscheiden Survivorship-Regeln, welcher Wert für jedes Feld gewinnt: Bevorzugung der aktuellsten Aktualisierung, der vertrauenswürdigsten Quelle oder des vollständigsten Eintrags – beispielsweise der offiziellen Produktbezeichnung eines Herstellers gegenüber einer Umformulierung durch einen Einzelhändler.
Warum ist das wichtig?
Dieselbe Entität existiert in den meisten Fällen in leicht unterschiedlichen Formen über mehrere Systeme hinweg – mit unterschiedlichen Schreibweisen, Attributwerten und Kennzeichnern. Wenn diese Duplikate nicht behoben werden, führen sie zu verfälschten Zählungen, verzerrten Berichten und machen eine zuverlässige einheitliche Sicht unmöglich. Match and Merge reduziert diese Fragmentierung auf einen genauen Datensatz, weshalb es im Zentrum des Master Data Management und jedes Versuchs liegt, eine vertrauenswürdige einzige Quelle der Wahrheit aufzubauen.