Visionneuse Gratuite de Fichiers Parquet

Inspectez les métadonnées des fichiers Apache Parquet dans votre navigateur. Affichez le schema, le nombre de lignes, les statistiques de colonnes et la structure du fichier. Gratuit, rapide et entièrement dans votre navigateur, sans inscription.

Mis à jour le

Share:
Home/Utility Tools/Parquet File Viewer

Parquet File Viewer

Inspect Apache Parquet file metadata, schema, and structure in your browser.

Parquet File Viewer

Read Row Data with Code

Full row data reading requires a Parquet library. Here are code snippets for common environments:

import pandas as pd

# Read a Parquet file
df = pd.read_parquet('your_file.parquet')
print(df.head())
print(df.dtypes)

About Apache Parquet

Apache Parquet is a columnar storage format designed for big data workloads. It stores data column-by-column rather than row-by-row, enabling efficient compression and predicate pushdown.

Files begin and end with the magic bytes PAR1. File metadata is Thrift-encoded and stored in the footer before the trailing magic.

Questions Fréquentes

Qu'est-ce que le Parquet File Viewer ?

Le Parquet File Viewer est un outil en ligne gratuit qui inspecte les métadonnées des fichiers Apache Parquet dans votre navigateur. Consultez le schéma, le nombre de lignes, les statistiques des colonnes et la structure du fichier. Il fonctionne entièrement dans votre navigateur, sans installation ni inscription.

Quelles informations puis-je voir ?

Le schéma du fichier, les types de colonnes, le nombre de groupes de lignes, le total des lignes, le codec de compression et les statistiques des colonnes (min/max).

Puis-je voir les données des lignes ?

Les métadonnées s'affichent directement. Pour les données complètes des lignes, l'outil fournit des extraits de code pour Python, Node.js et DuckDB-WASM.

Est-ce gratuit ?

Oui, entièrement gratuit.

Le Parquet File Viewer fonctionne-t-il sur les appareils mobiles ?

Oui, le Parquet File Viewer est entièrement adaptatif et fonctionne sur les smartphones et les tablettes. Vous pouvez l'utiliser sur n'importe quel appareil doté d'un navigateur web moderne, sans aucune application à télécharger.

Dois-je créer un compte pour utiliser cet outil ?

Aucun compte ni inscription n'est nécessaire. Ouvrez simplement le Parquet File Viewer dans votre navigateur et commencez à l'utiliser immédiatement. Il n'y a ni barrière d'inscription ni restriction d'utilisation.

Comment utiliser le Parquet File Viewer ?

Saisissez simplement vos données dans le champ prévu, ajustez les réglages selon vos préférences, et l'outil les traitera instantanément. Vous pourrez ensuite copier le résultat dans votre presse-papiers ou le télécharger.

Quels navigateurs sont pris en charge ?

Le Parquet File Viewer fonctionne sur tous les navigateurs modernes, dont Chrome, Firefox, Safari, Edge et Opera. Pour une expérience optimale, utilisez la dernière version de votre navigateur préféré.

Pourquoi un visualiseur Parquet peut-il afficher le schéma et le nombre de lignes d'un fichier volumineux instantanément, sans tout lire ?

Parquet stocke ses informations structurelles dans un footer encodé en Thrift à la toute fin du fichier, encadré par les octets magiques PAR1 au début et à la fin. Ce footer contient le schéma, le nombre total de lignes, les limites des row groups, le codec de compression et toute métadonnée clé-valeur intégrée. Comme tout cela tient dans un bloc compact, un visualiseur n'a besoin que de lire la longueur du footer, de s'y rendre et de le décoder, plutôt que de parcourir des gigaoctets de données colonnes. C'est pourquoi un fichier de plusieurs gigaoctets se décrit presque aussi vite qu'un tout petit fichier, et pourquoi vous pouvez vérifier la structure avant tout traitement lourd. Cet outil lit ce footer localement dans votre navigateur, si bien que même les gros fichiers affichent leur schéma et leur structure en quelques secondes. Déposez un fichier .parquet ci-dessus pour voir la vue d'ensemble sans ouvrir la moindre ligne de données.

Quelle est la différence entre un row group Parquet et une colonne ?

Une colonne est un champ unique de votre schéma, comme user_id ou created_at, stocké avec toutes ses valeurs regroupées pour une compression rapide et un élagage de colonnes efficace. Un row group est une tranche horizontale de la table entière : il regroupe un lot de lignes sur toutes les colonnes en une unité autonome, avec ses propres statistiques et sa propre taille sur disque. Un fichier d'un million de lignes peut les répartir sur plusieurs row groups, chaque groupe contenant toujours l'ensemble des colonnes. Les row groups permettent aux moteurs de requête d'ignorer des blocs entiers grâce aux statistiques min et max, ce qui rend le predicate pushdown efficace. Ce visualiseur affiche les deux vues : un onglet Schéma listant chaque colonne feuille avec son type, et un onglet Row Groups montrant le nombre de lignes et la taille par groupe. Déposez un fichier ci-dessus pour comparer sa disposition en colonnes avec son partitionnement en row groups.

Que m'apprend le champ created_by d'un fichier Parquet ?

La chaîne created_by indique quelle bibliothèque et quelle version ont écrit le fichier, par exemple une version précise de parquet-mr, d'Arrow ou de pandas. Elle est stockée dans les métadonnées du footer, aux côtés de la version du format. C'est réellement utile pour déboguer : certains outils d'écriture ont des particularités connues concernant les statistiques, l'encodage des timestamps ou la gestion d'INT96, donc connaître le producteur aide à expliquer un comportement étrange ou à décider de réexporter avec une chaîne d'outils plus récente. Cela confirme aussi la provenance quand un fichier vous est transmis sans contexte, en indiquant s'il provient de Spark, DuckDB, Polars ou d'un script pandas. Ce visualiseur affiche created_by directement dans la vue d'ensemble du fichier, à côté de la version du format et du codec de compression, pour vérifier l'outil d'origine avant d'intégrer le fichier à un pipeline. Déposez un fichier .parquet ci-dessus pour lire sa chaîne created_by.

Quels codecs de compression Parquet prend-il en charge, et comment savoir lequel utilise un fichier ?

Parquet compresse chaque bloc de colonne indépendamment, et le format définit plusieurs codecs : UNCOMPRESSED, SNAPPY, GZIP, LZO, BROTLI, LZ4, ZSTD et LZ4_RAW. SNAPPY est un choix par défaut courant car il équilibre vitesse et taux de compression, tandis que ZSTD produit souvent des fichiers plus petits pour un coût CPU modéré. Le codec est enregistré dans les métadonnées de chaque colonne au sein du footer, donc il n'est pas nécessaire de décompresser quoi que ce soit pour le connaître. Connaître le codec compte, car un lecteur qui ne prend pas en charge, par exemple, BROTLI ou LZ4_RAW échouera à ouvrir le fichier, et un codec inattendu peut faire gonfler ou réduire silencieusement le stockage. Ce visualiseur lit le codec dans le footer et l'affiche sous forme de badge dans la vue d'ensemble du fichier. Déposez votre fichier ci-dessus pour confirmer sa compression avant qu'un job n'en dépende.

Comment lire réellement les valeurs des lignes d'un fichier Parquet après avoir vérifié son schéma ici ?

Ce visualiseur inspecte les métadonnées plutôt que d'afficher les valeurs des cellules, ce qui garde l'analyse du footer rapide et légère. Pour lire les lignes elles-mêmes, il faut un décodeur Parquet complet ; c'est pourquoi l'outil fournit des extraits de code prêts à copier pour trois environnements courants. En Python, pandas lit un fichier en une seule ligne avec pd.read_parquet, le chemin habituel pour les analystes. En Node.js, le lecteur parquetjs-lite fait défiler les enregistrements via un curseur. Avec DuckDB-WASM, vous pouvez exécuter du SQL tel que read_parquet('your_file.parquet') directement dans le navigateur, sans serveur. Chaque extrait constitue une base fonctionnelle : copiez-le, pointez-le vers votre fichier, puis ajustez selon vos besoins. Le déroulé recommandé est de vérifier ici le schéma, les types et le nombre de lignes, puis de récupérer l'extrait correspondant à votre stack. Déposez un fichier ci-dessus, examinez la structure, puis copiez le code adapté à votre flux de travail.

À propos du visualiseur de fichiers Parquet

Le visualiseur de fichiers Parquet est un outil gratuit qui permet d'inspecter la structure d'un fichier Apache Parquet sans écrire une seule ligne de code. Déposez un fichier .parquet et l'outil lit les métadonnées du footer pour afficher le schéma, le nombre de lignes, les row groups, le codec de compression et toute métadonnée clé-valeur intégrée. Il a été conçu pour les data engineers, les analystes et les développeurs qui reçoivent un fichier Parquet et doivent répondre rapidement à une question simple — quelles colonnes contient-il, combien de lignes, et avec quel outil a-t-il été généré — avant de l'intégrer à un pipeline ou à un notebook.

Tout se passe dans votre navigateur. Le fichier est lu via l'API FileReader du navigateur et analysé localement : vos données ne quittent donc jamais votre appareil, il n'y a ni upload, ni compte à créer, ni limite de taille imposée par un serveur. Un point essentiel lorsque le fichier contient des données clients, des données financières, ou tout ce que vous n'oseriez pas coller sur un site quelconque.

Ce que le visualiseur lit dans un fichier Parquet

Parquet stocke ses métadonnées dans un footer encodé en Thrift à la fin du fichier, encadré par les octets magiques PAR1 au début et à la fin. Le visualiseur localise ce footer et le décode pour en tirer une vue d'ensemble lisible :

  • Vue d'ensemble du fichier — taille totale du fichier, nombre total de lignes, nombre de row groups et nombre de colonnes feuilles, présentés sous forme de résumé rapide.
  • Détails de format — la version du format Parquet, la chaîne created_by (l'outil qui a généré le fichier, par exemple une version précise d'Arrow ou de parquet-mr) et le codec de compression.
  • Schéma — chaque colonne feuille avec son nom, son type physique et sa répétition. Les types physiques incluent BOOLEAN, INT32, INT64, INT96, FLOAT, DOUBLE, BYTE_ARRAY et FIXED_LEN_BYTE_ARRAY. La répétition vaut REQUIRED, OPTIONAL ou REPEATED, ce qui indique si une colonne accepte les valeurs nulles ou contient des valeurs répétées.
  • Row groups — le détail par groupe du nombre de lignes, de la taille sur disque et du nombre de colonnes, pour visualiser comment le fichier a été partitionné en interne.
  • Métadonnées clé-valeur — toute métadonnée personnalisée intégrée par l'outil d'écriture, qui inclut souvent le schéma Arrow ou des notes propres au framework utilisé.

Les codecs de compression reconnus sont UNCOMPRESSED, SNAPPY, GZIP, LZO, BROTLI, LZ4, ZSTD et LZ4_RAW.

Lire les données réelles des lignes

Ce visualiseur inspecte les métadonnées, pas les valeurs des cellules — il n'affiche pas le contenu des lignes. C'est un choix délibéré : analyser le footer est rapide et léger, tandis que lire les données complètes des lignes nécessite un décodeur Parquet complet. Pour accéder aux valeurs elles-mêmes, l'outil fournit des extraits de code prêts à copier pour trois environnements courants :

  • Python avec pandas (pd.read_parquet), le chemin le plus courant pour les analystes.
  • Node.js via le lecteur parquetjs-lite.
  • DuckDB-WASM, qui permet d'interroger un fichier Parquet en SQL directement dans le navigateur via read_parquet('file.parquet').

Copiez l'extrait, pointez-le vers votre fichier, et vous obtenez une base fonctionnelle en quelques secondes.

Pourquoi vérifier les métadonnées Parquet en premier

Apache Parquet est un format de stockage columnaire conçu pour l'analytique et les charges de travail big data. Plutôt que de stocker les données ligne par ligne, il regroupe chaque colonne ensemble, ce qui rend la compression bien plus efficace et permet aux moteurs de requête d'ignorer les colonnes et row groups dont ils n'ont pas besoin — une technique appelée predicate pushdown. Comme le schéma et les statistiques résident dans le footer, un outil peut décrire un fichier de plusieurs gigaoctets presque instantanément, sans avoir à le parcourir.

Vérifier les métadonnées en premier fait gagner un temps précieux. Vous pouvez confirmer qu'une colonne a été écrite avec le type attendu, repérer un codec inattendu avant qu'un job n'échoue, vérifier la cohérence du nombre de lignes par rapport à ce qu'un export en amont aurait dû produire, ou lire le champ created_by pour identifier quel outil a généré un fichier qu'on vous a transmis. Pour quiconque débogue un pipeline de données, ces réponses viennent généralement avant même d'ouvrir les lignes.

Déposez un fichier .parquet ci-dessus pour voir son schéma et sa structure, puis récupérez un extrait de code si vous devez lire les lignes elles-mêmes.