Un dictionnaire de données est un document qui décrit le contenu, le format et la structure d’un jeu de données. C’est le manuel d’utilisation de vos données.
Ce que contient un dictionnaire de données
Pour chaque champ ou colonne d’un jeu de données, un dictionnaire de données documente généralement :
- Nom du champ — le nom technique utilisé dans le fichier ou la base de données
- Nom convivial — un nom lisible par l’humain
- Description — ce que le champ représente
- Type de données — texte, nombre entier, décimal, date, booléen, etc.
- Format — le format attendu (par exemple, AAAA-MM-JJ pour les dates)
- Valeurs valides — la plage ou la liste des valeurs acceptées
- Valeurs nulles — si les valeurs nulles sont permises
- Exemple — un exemple de valeur typique
Un champ nommé « cd_prov » pourrait être documenté comme suit : Nom convivial : Code de province. Description : Code à deux lettres de la province ou du territoire canadien. Type : Texte. Format : Deux lettres majuscules. Valeurs valides : AB, BC, MB, NB, NL, NS, NT, NU, ON, PE, QC, SK, YT. Nulles permises : Non.
Pourquoi les dictionnaires de données sont essentiels
Sans dictionnaire de données, les utilisateurs doivent deviner ce que signifient les champs, ce qui mène à des erreurs d’interprétation et à une mauvaise utilisation des données. Avec un dictionnaire, n’importe qui peut comprendre et utiliser correctement le jeu de données, même sans connaissances préalables.
Maintenir les dictionnaires de données
Les dictionnaires de données doivent être mis à jour quand les jeux de données changent. L’intendant des données est généralement responsable de maintenir le dictionnaire à jour. Un dictionnaire obsolète est presque aussi mauvais que pas de dictionnaire du tout.
Découvrez comment catégoriser les données selon leur sensibilité dans Classification.