Processus d'identification et de suppression des enregistrements en double dans un jeu de données pour s'assurer que chaque entité n'est représentée qu'une seule fois.
Le dédoublonnage des données est une tâche spécifique de qualité des données axée sur l'élimination des enregistrements redondants. Il est plus ciblé que le nettoyage général des données. Le dédoublonnage peut être exact (suppression des enregistrements identiques dans tous les champs) ou approximatif (identification des enregistrements représentant la même entité malgré des différences mineures d'orthographe, de format ou de saisie).
Le dédoublonnage approximatif utilise des techniques comme la correspondance de similarité de chaînes, la correspondance phonétique (Soundex, Metaphone) et l'apprentissage automatique pour identifier les doublons probables qui ne sont pas des copies exactes.
Exemple : Un registre national d'adresses compilé à partir de sources provinciales contient 2,3 millions d'enregistrements. Après le dédoublonnage exact, 180 000 doublons exacts sont supprimés. Le dédoublonnage approximatif identifie ensuite 45 000 doublons probables supplémentaires — la même adresse apparaissant avec de légères variations (« Ave » vs « Avenue », « St » vs « Rue »). La révision humaine confirme et fusionne les correspondances approximatives, résultant en un registre plus propre et plus fiable.