Une raffinerie de données est un processus systématique et reproductible pour prendre des données brutes et produire des données propres, fiables et prêtes à l’analyse. Plutôt que de nettoyer les données manuellement à chaque fois, une raffinerie automatise et standardise le processus.

Le concept de raffinerie

Pensez aux données brutes comme au pétrole brut — elles ont de la valeur, mais elles doivent être traitées avant d’être utiles. Une raffinerie de données applique une série de transformations : éliminer les impuretés (erreurs), standardiser la sortie et produire un produit cohérent et de haute qualité.

Composantes clés

Ingéstion

La raffinerie commence par ingérer des données brutes de leur source — un téléchargement de fichier, une base de données, une API ou un système de saisie manuelle. À ce stade, les données sont stockées dans leur forme originale sans modification.

Profilage

Avant le nettoyage, profilez les données pour comprendre leur état actuel : quels champs existent, à quel point ils sont complets, quelles valeurs apparaissent et quels problèmes sont présents.

Règles de nettoyage

Appliquez un ensemble documenté de règles de nettoyage : supprimer les doublons, standardiser les formats, valider par rapport aux données de référence, signaler ou imputer les valeurs manquantes. Chaque règle doit être documentée pour que le processus soit transparent et reproductible.

Validation

Après le nettoyage, validez la sortie par rapport aux règles de qualité. Les enregistrements qui échouent à la validation peuvent être mis en quarantaine pour examen manuel plutôt que d’être silencieusement transmis.

Sortie

Les données nettoyées sont écrites vers leur destination — une base de données, un fichier, une API — dans un format cohérent et documenté avec des métadonnées mises à jour.

Tout documenter

Une raffinerie n’est aussi bonne que sa documentation. Enregistrez chaque règle de nettoyage, chaque transformation et chaque décision. Cela rend le processus auditable, reproductible et améliorable dans le temps.

ETL et ELT

Le concept de raffinerie de données est étroitement lié à l’ETL (Extraire, Transformer, Charger) — un schéma standard pour déplacer et transformer les données. Les pipelines de données modernes utilisent souvent l’ELT (Extraire, Charger, Transformer), chargeant d’abord les données brutes et les transformant sur place.

Parcours terminé!

Vous avez terminé Nettoyage des données 101. Continuez avec Gouvernance des données 101 ou explorez le Glossaire.

← Assurance qualitéEnglish →