Format de fichier de stockage en colonnes optimisé pour le traitement de données à grande échelle et les charges de travail analytiques, largement utilisé dans les environnements de mégadonnées et en nuage.

Contrairement aux formats basés sur les lignes comme CSV (qui stockent toutes les valeurs d'un enregistrement ensemble), Parquet stocke toutes les valeurs d'une colonne ensemble. Cette disposition en colonnes permet de lire beaucoup plus rapidement uniquement les colonnes nécessaires pour une requête, et permet une compression efficace car des valeurs similaires sont stockées adjacentes les unes aux autres.

Parquet est le format préféré pour les grands jeux de données dans les plateformes analytiques comme Apache Spark, AWS Athena et Google BigQuery. Il est de plus en plus utilisé dans la publication de données ouvertes pour les grands jeux de données où les performances sont importantes.

Exemple : Un jeu de données national de 50 millions de transactions immobilières est publié en formats CSV et Parquet. Un scientifique des données qui n'a besoin que des colonnes de prix de vente et de date peut lire le fichier Parquet et récupérer uniquement ces deux colonnes sans charger l'ensemble du jeu de données en mémoire — une requête qui prend des secondes en Parquet pourrait prendre des minutes avec CSV.

Termes connexes

En savoir plus

← Retour au glossaire English →