Définition de l'appariement déterministe
L'appariement déterministe est une méthode d'identification des enregistrements qui font référence à la même personne, organisation ou article réel en appliquant des règles fixes exigeant que des champs spécifiques correspondent exactement. Par exemple, une règle peut stipuler que deux enregistrements clients sont identiques si leurs adresses e-mail sont identiques. Le résultat est toujours clairement oui ou non : les enregistrements respectent la règle ou ne la respectent pas.
Comment fonctionne l'appariement déterministe ?
Les règles d'appariement sont définies à l'avance, généralement de trois façons :
- Identifiant unique : les enregistrements correspondent s'ils partagent une valeur unique, comme un numéro d'identification fiscale, un numéro client, une adresse e-mail ou un code-barres produit.
- Champs combinés : les enregistrements correspondent uniquement si plusieurs champs sont tous identiques, comme le nom de famille, la date de naissance et le code postal ensemble.
- Règles ordonnées : plusieurs règles sont vérifiées en séquence, en commençant par la plus fiable. Si deux enregistrements partagent un numéro d'identification fiscale, ils correspondent ; sinon, la règle suivante est essayée, comme la correspondance sur le nom de l'entreprise et l'adresse.
Comme la comparaison est exacte, les résultats dépendent fortement de la cohérence de la saisie des données. C'est pourquoi les enregistrements sont généralement nettoyés et formatés de manière cohérente par normalisation des données avant l'appariement, par exemple en supprimant les espaces superflus et en écrivant tous les numéros de téléphone de la même manière.
Quels sont les avantages ?
L'appariement déterministe est simple à configurer, facile à expliquer et rapide à exécuter, même sur de grands ensembles de données. Chaque correspondance peut être retracée jusqu'à la règle qui l'a produite, ce qui rend les résultats faciles à vérifier et à auditer. Lorsqu'un identifiant partagé fiable existe, il produit rarement de fausses correspondances.
Quelles sont les limitations ?
- Correspondances manquées : de petites différences comme une faute de frappe, une abréviation ou une valeur manquante empêchent une correspondance, de sorte que « Acme Corp. » et « Acme Corporation » sont traités comme des entreprises différentes.
- Identifiants partagés : les valeurs qui semblent uniques ne le sont parfois pas, comme une adresse e-mail familiale ou le numéro de téléphone principal d'une entreprise, ce qui peut entraîner des correspondances incorrectes.
- Ensembles de règles croissants : couvrir plus de situations nécessite plus de règles, qui deviennent plus difficiles à maintenir au fil du temps.
En quoi est-ce différent de l'appariement probabiliste ?
L'appariement probabiliste compare plusieurs champs, permet les quasi-correspondances et calcule un score pour la probabilité que deux enregistrements soient identiques. Il trouve plus de correspondances dans les données désordonnées mais nécessite plus de réglage et produit certains cas incertains qui nécessitent un examen. L'appariement déterministe est le meilleur choix lorsque les données sont propres et que des identifiants fiables sont disponibles. De nombreuses organisations combinent les deux au sein d'un processus d'appariement et de fusion, en utilisant des règles déterministes pour les cas clairs et l'appariement probabiliste pour le reste.