Définition du profilage de données
Le profilage de données est le processus d'examen d'un ensemble de données pour comprendre sa structure, son contenu et sa qualité avant de l'utiliser ou de le migrer. Plutôt que de corriger les données, le profilage produit un diagnostic : le taux de complétude de chaque champ, les valeurs présentes et leur fréquence, les incohérences de format, ainsi que les doublons et anomalies.
Qu'analyse le profilage ?
Les contrôles de profilage typiques incluent la complétude (quel pourcentage d'enregistrements possède une valeur dans chaque champ), la distribution des valeurs (l'étendue et la fréquence des valeurs, qui révèlent les valeurs aberrantes comme un prix produit de -40), la cohérence de format (dates stockées sous les formes 01/02/2025 et 2025-02-01), l'unicité (champs qui devraient être uniques, comme les SKU, mais ne le sont pas), et les relations (si les références entre enregistrements se résolvent réellement).
Pourquoi est-ce important ?
Le profilage est l'étape essentielle avant toute migration de données, intégration système ou initiative de qualité des données. Les projets de migration échouent le plus souvent parce que les problèmes de données source sont découverts en cours de projet ; le profilage les identifie en amont, quand les corriger coûte le moins cher. Dans les plateformes MDM, les outils de profilage et de qualité travaillent ensemble pour analyser, nettoyer et normaliser les données, transformant l'approximation en plan de nettoyage délimité.
En quoi diffère-t-il de la validation de données ?
La validation de données applique des règles aux données à leur entrée ou lors de leur passage dans un système, rejetant les enregistrements qui ne les respectent pas. Le profilage est exploratoire : il examine les données existantes pour révéler leur état réel. Les résultats du profilage servent souvent à définir les règles de validation qui empêchent les mêmes problèmes de se reproduire.