Qu'est-ce que l'appariement flou ?

Définition de l'appariement flou

L'appariement flou est une technique permettant de trouver des valeurs ou des enregistrements similaires mais non identiques, comme « Jon Smith » et « John Smith » ou « 12 Main St. » et « 12 Main Street ». Au lieu de donner une simple réponse oui ou non, il mesure la proximité entre deux valeurs et retourne un score de similarité, ce qui permet de détecter les correspondances approchées causées par des fautes de frappe, des abréviations ou des différences de formatage.

Comment fonctionne l'appariement flou ?

Avant la comparaison, les valeurs sont généralement nettoyées en supprimant la ponctuation, en convertissant tout en minuscules et en développant les abréviations courantes. Les valeurs sont ensuite comparées à l'aide d'une ou de plusieurs méthodes :

  • Différences de caractères : comptage du nombre de lettres qui doivent être ajoutées, supprimées ou modifiées pour transformer une valeur en une autre. « Smith » et « Smyth » diffèrent d'une lettre, ils obtiennent donc un score de très grande similarité.
  • Comparaison phonétique : comparaison de la prononciation des mots plutôt que de leur orthographe, ce qui permet de reconnaître « Meyer » et « Maier » comme le même nom.
  • Comparaison basée sur les mots : comparaison des mots dans chaque valeur indépendamment de l'ordre, ainsi « Smith, John » et « John Smith » sont traités comme une correspondance.
  • Chevauchement partiel : comparaison de courts fragments de texte, ce qui est utile pour les longues valeurs comme les descriptions de produits ou les noms d'entreprises.

Le résultat est un score, souvent exprimé en pourcentage. Les valeurs qui obtiennent un score au-dessus d'un seuil choisi sont traitées comme des correspondances ou signalées pour révision.

Où l'appariement flou est-il utilisé ?

  • Détection des doublons : identification du même client, fournisseur ou produit saisi plusieurs fois, dans le cadre de la déduplication des données.
  • Combinaison de données provenant de sources différentes : liaison d'enregistrements de deux systèmes qui orthographient différemment les noms ou les adresses, par exemple après une fusion d'entreprises.
  • Recherche : retour de résultats utiles même lorsqu'un utilisateur fait une faute de frappe dans son terme de recherche.
  • Vérification des données entrantes : comparaison des nouveaux enregistrements avec les enregistrements existants avant leur ajout, afin que les doublons soient détectés rapidement.

Quel est son lien avec l'appariement probabiliste ?

L'appariement flou compare une valeur à la fois, comme deux noms ou deux adresses. L'appariement probabiliste s'appuie sur ce principe en combinant les scores de similarité de plusieurs champs, comme le nom, l'adresse et le numéro de téléphone, en une probabilité globale que deux enregistrements décrivent la même entité. En pratique, l'appariement flou est souvent l'un des éléments constitutifs d'un processus plus large d'appariement et fusion.

Quelles sont ses limitations ?

L'appariement flou peut produire des fausses correspondances, particulièrement avec des valeurs courtes : « Jon » et « Joan » semblent similaires mais sont des noms différents, et deux produits portant des noms presque identiques peuvent être des modèles différents. Il peut aussi manquer des correspondances où la même chose est décrite avec des mots complètement différents, comme le nom juridique d'une entreprise et sa marque commerciale. Comparer chaque enregistrement avec tous les autres est lent sur les grands ensembles de données, les systèmes limitent généralement d'abord la comparaison, par exemple en ne comparant que les enregistrements du même code postal. Les seuils nécessitent des tests et des ajustements pour équilibrer les correspondances manquées et les correspondances incorrectes.