Séquence automatisée d'étapes qui déplace et transforme les données d'un système à un autre.

Un pipeline de données gère le flux de données depuis sa source — une base de données, une API, un fichier — à travers une série d'étapes de traitement, jusqu'à une destination comme un entrepôt de données ou un outil d'analyse. Chaque étape peut filtrer, nettoyer, enrichir ou reformater les données.

Les pipelines peuvent s'exécuter selon un calendrier (traitement par lots) ou en continu au fur et à mesure que de nouvelles données arrivent (diffusion en continu). Ils constituent l'infrastructure qui maintient les produits de données à jour sans intervention manuelle.

Exemple : L'équipe de données ouvertes d'une ville exécute un pipeline nocturne qui extrait les dossiers de permis d'un système interne, normalise les formats d'adresse, supprime les entrées de test et charge le jeu de données nettoyé dans le portail public avant 6 h.

Comprendre les pipelines aide à expliquer pourquoi les jeux de données publiés ont un délai, pourquoi les formats sont cohérents et ce que font les processus ETL en coulisses.

Termes connexes

En savoir plus

← Retour au glossaire English →