¿Qué es el Matching Probabilístico?

Definición de Matching Probabilístico

Matching probabilístico es un método para identificar registros que probablemente se refieren a la misma persona, organización o elemento real comparando varios campos simultáneamente y calculando una puntuación sobre la probabilidad de que coincidan. En lugar de requerir que los valores sean idénticos, pondera qué tan cerca concuerdan los campos y qué tan significativa es esa concordancia, lo que permite encontrar coincidencias a pesar de errores tipográficos, valores faltantes o diferentes ortografías.

¿Cómo funciona el matching probabilístico?

El proceso generalmente sigue cuatro pasos:

  1. Comparar campos: se comparan dos registros campo por campo, por ejemplo nombre, dirección, fecha de nacimiento y número de teléfono. Las comparaciones suelen permitir pequeñas diferencias, de modo que "Jon Smith" y "John Smith" pueden contar como similares.
  2. Aplicar pesos: cada campo recibe un peso en función de cuán fuertemente la concordancia sugiere una coincidencia. La concordancia en un apellido raro cuenta más que la concordancia en uno común, y un ID fiscal coincidente cuenta más que una ciudad coincidente.
  3. Calcular una puntuación: los pesos se combinan en una única puntuación de coincidencia para el par de registros.
  4. Ordenar por umbrales: los pares por encima de un umbral superior se tratan como coincidencias, los pares por debajo de un umbral inferior como no coincidencias, y los pares intermedios se señalan para que una persona los revise.

Una vez confirmadas las coincidencias, los registros suelen combinarse en una única versión confiable, frecuentemente denominada disco de oro.

¿En qué se diferencia del matching determinístico?

Matching determinístico utiliza reglas fijas: los registros coinciden solo si campos específicos son exactamente iguales, como la misma dirección de correo electrónico o el mismo ID de cliente. Es simple, rápido y fácil de explicar, pero pierde coincidencias cada vez que los datos se ingresan de forma inconsistente.

Matching probabilístico intercambia parte de esa simplicidad por flexibilidad. Puede reconocer que "Acme Corp., 12 Main St." y "ACME Corporation, 12 Main Street" son probablemente la misma empresa, cuando las reglas exactas las tratarían como diferentes. Muchas organizaciones utilizan ambos: reglas determinísticas para casos evidentes y matching probabilístico para todo lo demás.

¿Cuáles son los riesgos y compensaciones?

  • Coincidencias falsas: dos personas o empresas diferentes pueden fusionarse por error si los umbrales se establecen demasiado bajos, lo cual puede ser difícil de deshacer.
  • Coincidencias perdidas: los umbrales establecidos demasiado altos dejan duplicados en su lugar.
  • Esfuerzo de ajuste: los pesos y umbrales deben probarse y ajustarse para cada conjunto de datos, y revisarse a medida que cambian los datos.
  • Carga de revisión: el grupo de "posible coincidencia" requiere que las personas tomen decisiones, y un grupo grande puede crear un retraso.

¿Dónde se utiliza el matching probabilístico?

Se utiliza dondequiera que la misma entidad aparezca en varios sistemas o conjuntos de datos sin un identificador compartido. Los ejemplos comunes incluyen la consolidación de registros de clientes en gestión de datos maestros (MDM), comparación de registros de pacientes en hospitales, vinculación de registros de proveedores después de una fusión empresarial y eliminación de duplicados antes de una migración de datos. Es una de las técnicas principales detrás de match and merge.