Les enregistrements en double se produisent quand la même entité du monde réel apparaît plus d’une fois dans un jeu de données. Un client listé deux fois sous des noms légèrement différents, une transaction enregistrée dans deux systèmes, un emplacement apparaissant avec deux orthographes différentes — tous sont des doublons.

Pourquoi les doublons sont nuisibles

Les doublons gonflent les décomptes, faussent les analyses et causent des problèmes opérationnels. Si un client apparaît deux fois dans une liste de diffusion, il reçoit deux copies de chaque communication. Si un produit apparaît deux fois dans un système d’inventaire, les décomptes de stock sont erronés.

Types de doublons

Doublons exacts — lignes identiques dans tous les champs. Faciles à détecter et à supprimer.

Quasi-doublons — enregistrements représentant la même entité mais différant légèrement. « Jean Tremblay, 123 rue Principale » et « J. Tremblay, 123 Principale » sont des quasi-doublons. Ils nécessitent une correspondance floue pour être détectés.

Trouver les doublons

Pour les doublons exacts, triez les données et recherchez des lignes consécutives identiques, ou utilisez une requête GROUP BY pour trouver des lignes avec les mêmes champs clés apparaissant plus d’une fois.

Pour les quasi-doublons, les techniques incluent : la correspondance phonétique (Soundex) pour les noms, la distance d’édition (distance de Levenshtein) pour les chaînes, et le blocage — regrouper les enregistrements par un attribut partagé avant de les comparer.

Résoudre les doublons

Quand vous trouvez des doublons, vous devez décider quel enregistrement conserver (ou comment les fusionner). C’est ce qu’on appelle la déduplication ou le couplage d’enregistrements. L’« enregistrement d’or » est la version fusionnée et faisant autorité qui combine les meilleures informations de tous les doublons.

Prochaine étape

Découvrez les Problèmes de format.

← Valeurs manquantesProblèmes de format →English →