Définition de l'appariement probabiliste
L'appariement probabiliste est une méthode permettant d'identifier les enregistrements qui font probablement référence à la même personne, organisation ou élément réel en comparant plusieurs champs simultanément et en calculant un score de probabilité d'appariement. Au lieu d'exiger que les valeurs soient identiques, il évalue la proximité de chaque champ et l'importance de cette concordance, ce qui permet de trouver des appariements malgré les fautes de frappe, les valeurs manquantes ou les orthographes différentes.
Comment fonctionne l'appariement probabiliste ?
Le processus suit généralement quatre étapes :
- Comparer les champs : deux enregistrements sont comparés champ par champ, par exemple le nom, l'adresse, la date de naissance et le numéro de téléphone. Les comparaisons autorisent souvent de petites différences, de sorte que « Jon Smith » et « John Smith » peuvent toujours être considérés comme similaires.
- Appliquer des pondérations : chaque champ reçoit une pondération basée sur la force avec laquelle la concordance suggère un appariement. La concordance sur un nom de famille rare compte davantage que la concordance sur un nom courant, et un numéro fiscal correspondant compte davantage qu'une ville correspondante.
- Calculer un score : les pondérations sont combinées en un seul score d'appariement pour la paire d'enregistrements.
- Trier par seuils : les paires au-dessus d'un seuil supérieur sont traitées comme des appariements, les paires en dessous d'un seuil inférieur comme des non-appariements, et les paires entre les deux sont signalées pour examen par une personne.
Une fois les appariements confirmés, les enregistrements sont généralement fusionnés en une seule version de confiance, souvent appelée disque d'or.
En quoi est-ce différent de l'appariement déterministe ?
L'appariement déterministe utilise des règles fixes : les enregistrements ne correspondent que si des champs spécifiques sont exactement égaux, comme la même adresse e-mail ou le même identifiant client. C'est simple, rapide et facile à expliquer, mais il manque les appariements chaque fois que les données sont saisies de manière incohérente.
L'appariement probabiliste échange une partie de cette simplicité contre la flexibilité. Il peut reconnaître que « Acme Corp., 12 Main St. » et « ACME Corporation, 12 Main Street » sont probablement la même entreprise, alors que les règles exactes les traiteraient comme différentes. De nombreuses organisations utilisent les deux : les règles déterministes pour les cas évidents et l'appariement probabiliste pour tout le reste.
Quels sont les risques et les compromis ?
- Faux appariements : deux personnes ou entreprises différentes peuvent être fusionnées par erreur si les seuils sont trop bas, ce qui peut être difficile à annuler.
- Appariements manqués : les seuils trop élevés laissent les doublons en place.
- Effort d'ajustement : les pondérations et les seuils doivent être testés et ajustés pour chaque ensemble de données, et révisés à mesure que les données changent.
- Charge de travail d'examen : le groupe des « appariements possibles » nécessite que des personnes prennent des décisions, et un groupe important peut créer un arriéré.
Où l'appariement probabiliste est-il utilisé ?
Il est utilisé partout où la même entité apparaît dans plusieurs systèmes ou ensembles de données sans identifiant partagé. Les exemples courants incluent la combinaison des enregistrements clients dans la gestion des données de référence (MDM), l'appariement des dossiers patients dans les hôpitaux, la liaison des enregistrements de fournisseurs après une fusion d'entreprise et la suppression des doublons avant une migration de données. C'est l'une des techniques fondamentales derrière l'appariement et fusion.