Ligne de données qui apparaît plus d'une fois dans un jeu de données, souvent en raison d'erreurs système, de fusion de données ou d'importations répétées.
Les doublons gonflent les dénombrements, faussent les moyennes et produisent des résultats d'analyse incorrects. Ils constituent l'un des problèmes de qualité des données les plus courants et peuvent être étonnamment difficiles à détecter lorsque les doublons ne sont pas des copies exactes — par exemple, la même personne apparaissant avec des orthographes légèrement différentes du nom ou des formats d'adresse différents.
Exemple : Un jeu de données d'électeurs inscrits est compilé à partir de deux systèmes régionaux. La même personne apparaît deux fois — une fois comme « Jean Tremblay, 123 rue Main » et une fois comme « J. Tremblay, 123 Main St. ». Ce sont des doublons, mais une simple vérification de correspondance exacte ne les détecterait pas. La logique de dédoublonnage doit tenir compte des variations.
Termes connexes
- Dédoublonnage des données
- Qualité des données
- Nettoyage des données
- Clé primaire
- Profilage des données