Kostenloser Parquet-Datei-Viewer
Untersuchen Sie die Metadaten von Apache-Parquet-Dateien in Ihrem Browser. Sehen Sie sich Schema, Zeilenanzahl, Spaltenstatistiken und Dateistruktur an. Kostenlos, schnell und vollständig im Browser, ohne Anmeldung.
Aktualisiert am
Parquet File Viewer
Inspect Apache Parquet file metadata, schema, and structure in your browser.
Parquet File Viewer
Read Row Data with Code
Full row data reading requires a Parquet library. Here are code snippets for common environments:
import pandas as pd
# Read a Parquet file
df = pd.read_parquet('your_file.parquet')
print(df.head())
print(df.dtypes)About Apache Parquet
Apache Parquet is a columnar storage format designed for big data workloads. It stores data column-by-column rather than row-by-row, enabling efficient compression and predicate pushdown.
Files begin and end with the magic bytes PAR1. File metadata is Thrift-encoded and stored in the footer before the trailing magic.
Häufig gestellte Fragen
Was ist der Parquet File Viewer?
Der Parquet File Viewer ist ein kostenloses Online-Tool, das die Metadaten von Apache-Parquet-Dateien direkt in deinem Browser auswertet. Sieh dir Schema, Zeilenanzahl, Spaltenstatistiken und Dateistruktur an. Es läuft vollständig in deinem Browser, ohne Installation oder Anmeldung.
Welche Informationen kann ich sehen?
Das Dateischema, die Spaltentypen, die Anzahl der Zeilengruppen, die Gesamtzahl der Zeilen, den Komprimierungscodec und die Spaltenstatistiken (Min/Max).
Kann ich die Zeilendaten ansehen?
Die Metadaten werden direkt angezeigt. Für die vollständigen Zeilendaten bietet das Tool Code-Snippets für Python, Node.js und DuckDB-WASM.
Ist es kostenlos?
Ja, völlig kostenlos.
Funktioniert der Parquet File Viewer auf Mobilgeräten?
Ja, der Parquet File Viewer ist vollständig responsiv und funktioniert auf Smartphones und Tablets. Du kannst ihn auf jedem Gerät mit einem modernen Webbrowser nutzen, ganz ohne App-Download.
Muss ich ein Konto erstellen, um dieses Tool zu nutzen?
Es ist kein Konto und keine Registrierung erforderlich. Öffne einfach den Parquet File Viewer in deinem Browser und leg sofort los. Es gibt keine Anmeldeschranken oder Nutzungsbeschränkungen.
Wie verwende ich den Parquet File Viewer?
Gib einfach deine Eingabe in das vorgesehene Feld ein, passe die Einstellungen nach deinen Wünschen an, und das Tool verarbeitet sie sofort. Anschließend kannst du das Ergebnis in die Zwischenablage kopieren oder herunterladen.
Welche Browser werden unterstützt?
Der Parquet File Viewer funktioniert in allen modernen Browsern, darunter Chrome, Firefox, Safari, Edge und Opera. Für das beste Erlebnis verwende die neueste Version deines bevorzugten Browsers.
Warum kann ein Parquet-Viewer Schema und Zeilenanzahl einer riesigen Datei sofort anzeigen, ohne sie komplett zu lesen?
Parquet speichert seine Strukturinformationen in einem Thrift-kodierten Footer ganz am Ende der Datei, eingerahmt von den Magic Bytes PAR1 am Anfang und am Ende. Dieser Footer enthält das Schema, die Gesamtzahl der Zeilen, die Grenzen der Row Groups, den Kompressions-Codec und eingebettete Key-Value-Metadaten. Da all das in einem einzigen kompakten Block liegt, muss ein Viewer nur die Footer-Länge lesen, zum Footer springen und ihn dekodieren, statt Gigabytes an Spaltendaten zu durchsuchen. Deshalb beschreibt sich eine mehrere Gigabyte große Datei fast so schnell selbst wie eine winzige, und deshalb lässt sich die Struktur prüfen, bevor eine aufwendige Verarbeitung beginnt. Dieses Tool liest den Footer lokal in deinem Browser, sodass selbst große Dateien Schema und Struktur innerhalb von Sekunden anzeigen. Lade oben eine .parquet-Datei hoch, um die Übersicht zu sehen, ohne eine einzige Zeile Daten zu öffnen.
Was ist der Unterschied zwischen einer Parquet-Row-Group und einer Spalte?
Eine Spalte ist ein einzelnes Feld im Schema, etwa user_id oder created_at, das zusammen mit allen seinen Werten gespeichert wird, um Kompression und Column Pruning zu ermöglichen. Eine Row Group ist dagegen ein horizontaler Ausschnitt der gesamten Tabelle: Sie bündelt einen Block von Zeilen über alle Spalten hinweg zu einer eigenständigen Einheit mit eigenen Statistiken und eigener Größe auf der Festplatte. Eine Datei mit einer Million Zeilen kann diese auf mehrere Row Groups verteilen, wobei jede Gruppe weiterhin alle Spalten enthält. Row Groups erlauben es Query-Engines, ganze Blöcke anhand von Min- und Max-Statistiken zu überspringen, was Predicate Pushdown erst wirksam macht. Dieser Viewer zeigt beide Sichten: einen Schema-Tab mit jeder Blattspalte samt Typ und einen Row-Groups-Tab mit Zeilenanzahl und Größe pro Gruppe. Lade oben eine Datei hoch, um ihr Spaltenlayout mit der Row-Group-Partitionierung zu vergleichen.
Was verrät mir das Feld created_by in einer Parquet-Datei?
Der created_by-String hält fest, welche Bibliothek und Version die Datei geschrieben hat, zum Beispiel eine bestimmte parquet-mr-, Arrow- oder pandas-Version. Er wird in den Footer-Metadaten neben der Formatversion gespeichert. Das ist beim Debuggen wirklich nützlich: Bestimmte Writer haben bekannte Eigenheiten bei Statistiken, Timestamp-Encoding oder der Behandlung von INT96, sodass die Kenntnis des Erzeugers hilft, ungewöhnliches Verhalten zu erklären oder zu entscheiden, ob ein Re-Export mit einer neueren Toolchain sinnvoll ist. Außerdem bestätigt es die Herkunft, wenn dir eine Datei ohne Kontext übergeben wird, und zeigt, ob sie aus Spark, DuckDB, Polars oder einem pandas-Skript stammt. Dieser Viewer zeigt created_by direkt in der Dateiübersicht an, neben Formatversion und Kompressions-Codec, sodass du den Writer prüfen kannst, bevor die Datei in eine Pipeline wandert. Lade eine .parquet-Datei oben hoch, um ihren created_by-String zu lesen.
Welche Kompressions-Codecs unterstützt Parquet, und wie prüfe ich, welchen eine Datei verwendet?
Parquet komprimiert jeden Column Chunk unabhängig, und das Format definiert mehrere Codecs: UNCOMPRESSED, SNAPPY, GZIP, LZO, BROTLI, LZ4, ZSTD und LZ4_RAW. SNAPPY ist ein verbreiteter Standard, weil er Geschwindigkeit und Kompressionsrate ausbalanciert, während ZSTD oft kleinere Dateien bei moderat höherem CPU-Aufwand liefert. Der Codec wird in den Metadaten jeder Spalte im Footer festgehalten, sodass nichts dekomprimiert werden muss, um ihn herauszufinden. Das ist relevant, weil ein Reader ohne Unterstützung für etwa BROTLI oder LZ4_RAW die Datei nicht öffnen kann und ein unerwarteter Codec den Speicherbedarf unbemerkt aufblähen oder verringern kann. Dieser Viewer liest den Codec aus dem Footer und zeigt ihn als Badge in der Dateiübersicht an. Lade deine Datei oben hoch, um die Kompression zu prüfen, bevor ein Job davon abhängt.
Wie lese ich die eigentlichen Zeilenwerte aus einer Parquet-Datei aus, nachdem ich hier das Schema geprüft habe?
Dieser Viewer untersucht Metadaten statt Zellwerte auszugeben, was das Parsen des Footers schnell und ressourcenschonend hält. Um die Zeilen selbst zu lesen, braucht es einen vollständigen Parquet-Decoder, daher liefert das Tool fertige, kopierbare Code-Snippets für drei gängige Umgebungen. In Python liest pandas eine Datei mit einer einzigen Zeile über pd.read_parquet, der übliche Weg für Analysten. In Node.js streamt der parquetjs-lite-Reader Datensätze über einen Cursor. Mit DuckDB-WASM lässt sich SQL wie read_parquet('your_file.parquet') direkt im Browser ausführen, ganz ohne Server. Jedes Snippet ist ein funktionierender Ausgangspunkt: kopieren, auf die eigene Datei anwenden und von dort aus anpassen. Der empfohlene Ablauf: zuerst hier Schema, Typen und Zeilenanzahl prüfen, dann das passende Snippet für den eigenen Stack kopieren. Lade oben eine Datei hoch, sieh dir die Struktur an und kopiere anschließend den Code, der zu deinem Workflow passt.
Verwandte Tools
Kostenloser Generator für sichere Passwörter
Erstelle sichere, zufällige Passwörter mit anpassbaren Optionen. Kostenlos, schnell und vollständig in deinem Browser ohne Anmeldung.
Kostenloser UUID/GUID-Generator
Erstelle universell eindeutige Bezeichner (UUID/GUID). Kostenlos, schnell und vollständig in deinem Browser ohne Anmeldung.
Kostenloser QR-Code-Generator Online
Erstelle QR-Codes für URLs, Text, WLAN-Zugangsdaten und mehr. Kostenlos, schnell und vollständig in deinem Browser ohne Anmeldung.
Kostenloser JSON-Formatierer & Validator
Formatiere, validiere und verschönere JSON-Daten mit Syntaxhervorhebung und Fehlererkennung. Kostenlos, schnell und vollständig in deinem Browser ohne Anmeldung.
Über den kostenlosen Parquet File Viewer
Der Parquet File Viewer ist ein kostenloses Tool, mit dem sich die Struktur einer Apache-Parquet-Datei ohne eine einzige Zeile Code untersuchen lässt. Ziehe eine .parquet-Datei hinein, und das Tool liest die Footer-Metadaten der Datei aus, um dir Schema, Zeilenanzahl, Row Groups, Kompressions-Codec und eingebettete Key-Value-Metadaten anzuzeigen. Entwickelt wurde es für Data Engineers, Analysten und Entwickler, die eine Parquet-Datei erhalten und schnell eine Frage beantworten müssen — welche Spalten sind enthalten, wie viele Zeilen gibt es, und womit wurde die Datei geschrieben — bevor sie in eine Pipeline oder ein Notebook geladen wird.
Alles läuft direkt im Browser ab. Die Datei wird mit dem FileReader des Browsers gelesen und lokal geparst, sodass deine Daten dein Gerät nie verlassen — es gibt weder einen Upload noch ein Konto noch eine serverseitige Größenbeschränkung. Das ist besonders relevant, wenn die Datei Kundendaten, Finanzdaten oder andere Informationen enthält, die du nicht auf einer beliebigen Website hochladen möchtest.
Was der Viewer aus einer Parquet-Datei ausliest
Parquet speichert seine Metadaten in einem Thrift-kodierten Footer am Ende der Datei, eingerahmt von den Magic Bytes PAR1 sowohl am Anfang als auch am Ende. Der Viewer findet diesen Footer und dekodiert ihn zu einer übersichtlichen Zusammenfassung:
- Dateiübersicht — Gesamtgröße der Datei, Gesamtzahl der Zeilen, Anzahl der Row Groups und Anzahl der Blattspalten (leaf columns), dargestellt als kompakte Zusammenfassung.
- Formatdetails — die Parquet-Formatversion, der
created_by-String (der Writer, der die Datei erzeugt hat, etwa eine bestimmte Arrow- oder parquet-mr-Version) und der Kompressions-Codec. - Schema — jede Blattspalte mit Name, physischem Typ und Repetition. Zu den physischen Typen zählen
BOOLEAN,INT32,INT64,INT96,FLOAT,DOUBLE,BYTE_ARRAYundFIXED_LEN_BYTE_ARRAY. Die Repetition ist entwederREQUIRED,OPTIONALoderREPEATEDund zeigt an, ob eine Spalte Nullwerte zulässt oder wiederholte Werte enthält. - Row Groups — eine Aufschlüsselung pro Gruppe mit Zeilenanzahl, Größe auf der Festplatte und Spaltenanzahl, sodass du erkennst, wie die Datei intern partitioniert wurde.
- Key-Value-Metadaten — jegliche benutzerdefinierten Metadaten, die der Writer eingebettet hat, häufig einschließlich des Arrow-Schemas oder Framework-spezifischer Hinweise.
Erkannte Kompressions-Codecs sind UNCOMPRESSED, SNAPPY, GZIP, LZO, BROTLI, LZ4, ZSTD und LZ4_RAW.
Die eigentlichen Zeilendaten auslesen
Dieser Viewer untersucht Metadaten, nicht die Zellwerte selbst — er gibt die Zeilen nicht aus. Das ist eine bewusste Entscheidung: Das Parsen des Footers ist schnell und ressourcenschonend, während das Lesen vollständiger Zeilendaten einen kompletten Parquet-Decoder erfordert. Um an die eigentlichen Werte zu kommen, liefert das Tool fertige, kopierbare Code-Snippets für drei gängige Umgebungen:
- Python mit pandas (
pd.read_parquet), der gängigste Weg für Analysten. - Node.js mit dem
parquetjs-lite-Reader. - DuckDB-WASM, mit dem sich eine Parquet-Datei per SQL direkt im Browser abfragen lässt, über
read_parquet('file.parquet').
Snippet kopieren, auf die eigene Datei anwenden — und in Sekunden hast du einen funktionierenden Ausgangspunkt.
Warum sich ein Blick auf die Parquet-Metadaten zuerst lohnt
Apache Parquet ist ein spaltenorientiertes Speicherformat für Analytics- und Big-Data-Workloads. Statt Daten zeilenweise zu speichern, werden die Werte jeder Spalte zusammenhängend abgelegt, was Kompression deutlich effektiver macht und es Query-Engines erlaubt, nicht benötigte Spalten und Row Groups zu überspringen — eine Technik namens Predicate Pushdown. Da Schema und Statistiken im Footer liegen, kann ein Tool eine mehrere Gigabyte große Datei fast augenblicklich beschreiben, ohne sie zu durchsuchen.
Ein vorheriger Blick auf die Metadaten spart echte Zeit. So lässt sich bestätigen, dass eine Spalte mit dem erwarteten Typ geschrieben wurde, ein unerwarteter Codec fällt auf, bevor ein Job fehlschlägt, die Zeilenanzahl lässt sich gegen das erwartete Ergebnis eines vorgelagerten Exports prüfen, oder das created_by-Feld verrät, mit welchem Tool eine übergebene Datei erzeugt wurde. Wer eine Datenpipeline debuggt, braucht diese Antworten meist, bevor überhaupt die Zeilen geöffnet werden.
Lade oben eine .parquet-Datei hoch, um Schema und Struktur zu sehen, und hol dir anschließend ein Code-Snippet, falls du die Zeilen selbst auslesen möchtest.