Visor Gratis de Archivos Parquet

Inspecciona los metadatos de archivos Apache Parquet en tu navegador. Visualiza el schema, el recuento de filas, las estadísticas de columnas y la estructura del archivo. Gratis, rápido y funciona totalmente en tu navegador sin registro.

Actualizado

Share:
Home/Utility Tools/Parquet File Viewer

Parquet File Viewer

Inspect Apache Parquet file metadata, schema, and structure in your browser.

Parquet File Viewer

Read Row Data with Code

Full row data reading requires a Parquet library. Here are code snippets for common environments:

import pandas as pd

# Read a Parquet file
df = pd.read_parquet('your_file.parquet')
print(df.head())
print(df.dtypes)

About Apache Parquet

Apache Parquet is a columnar storage format designed for big data workloads. It stores data column-by-column rather than row-by-row, enabling efficient compression and predicate pushdown.

Files begin and end with the magic bytes PAR1. File metadata is Thrift-encoded and stored in the footer before the trailing magic.

Preguntas Frecuentes

¿Qué es el Parquet File Viewer?

El Parquet File Viewer es una herramienta online gratuita que inspecciona los metadatos de archivos Apache Parquet en tu navegador. Visualiza el esquema, el número de filas, las estadísticas de columnas y la estructura del archivo. Funciona por completo en tu navegador, sin necesidad de instalación ni registro.

¿Qué información puedo ver?

El esquema del archivo, los tipos de columna, el número de grupos de filas, el total de filas, el códec de compresión y las estadísticas de columnas (mín./máx.).

¿Puedo ver los datos de las filas?

Los metadatos se muestran directamente. Para ver los datos completos de las filas, la herramienta ofrece fragmentos de código para Python, Node.js y DuckDB-WASM.

¿Es gratis?

Sí, completamente gratis.

¿Funciona el Parquet File Viewer en dispositivos móviles?

Sí, el Parquet File Viewer es totalmente adaptable y funciona en smartphones y tablets. Puedes usarlo en cualquier dispositivo con un navegador web moderno, sin necesidad de descargar ninguna app.

¿Necesito crear una cuenta para usar esta herramienta?

No se necesita cuenta ni registro. Solo abre el Parquet File Viewer en tu navegador y empieza a usarlo de inmediato. No hay muros de registro ni restricciones de uso.

¿Cómo uso el Parquet File Viewer?

Solo introduce tu entrada en el campo correspondiente, ajusta las opciones a tu gusto y la herramienta la procesará al instante. Después podrás copiar el resultado al portapapeles o descargarlo.

¿Qué navegadores son compatibles?

El Parquet File Viewer funciona en todos los navegadores modernos, incluidos Chrome, Firefox, Safari, Edge y Opera. Para una mejor experiencia, usa la última versión de tu navegador preferido.

¿Por qué un visor de Parquet puede mostrar el esquema y el número de filas de un archivo enorme al instante sin leerlo entero?

Parquet almacena su información estructural en un footer codificado en Thrift al final del archivo, delimitado por los bytes mágicos PAR1 tanto al inicio como al final. Ese footer contiene el esquema, el número total de filas, los límites de los row groups, el códec de compresión y cualquier metadato clave-valor incrustado. Como todo esto vive en un bloque compacto, un visor solo necesita leer la longitud del footer, saltar hasta él y decodificarlo, en lugar de escanear gigabytes de datos de columnas. Por eso un archivo de varios gigabytes describe su propia estructura casi tan rápido como uno diminuto, y por eso puedes verificar la estructura antes de cualquier procesamiento pesado. Esta herramienta lee ese footer localmente en tu navegador, así que incluso los archivos grandes muestran su esquema y estructura en segundos. Sube un archivo .parquet arriba para ver el resumen sin abrir una sola fila de datos.

¿Cuál es la diferencia entre un row group de Parquet y una columna?

Una columna es un campo individual de tu esquema, como user_id o created_at, almacenado junto con todos sus valores para lograr una compresión rápida y permitir el column pruning. Un row group es un corte horizontal de toda la tabla: agrupa un bloque de filas de todas las columnas en una unidad autocontenida con sus propias estadísticas y tamaño en disco. Un archivo con un millón de filas podría dividirlas en varios row groups, y cada grupo sigue conteniendo todas las columnas. Los row groups permiten que los motores de consulta omitan bloques enteros que no necesitan usando estadísticas de mínimo y máximo, lo que hace efectivo el predicate pushdown. Este visor muestra ambas vistas: una pestaña de Esquema que lista cada columna hoja con su tipo, y una pestaña de Row Groups que muestra el número de filas y el tamaño de cada grupo. Sube un archivo arriba para comparar su distribución de columnas frente a su particionamiento en row groups.

¿Qué me indica el campo created_by de un archivo Parquet?

La cadena created_by registra qué librería y versión escribió el archivo, por ejemplo una versión concreta de parquet-mr, Arrow o pandas. Se almacena en los metadatos del footer junto a la versión del formato. Esto resulta realmente útil al depurar: ciertos escritores tienen particularidades conocidas con las estadísticas, la codificación de timestamps o el manejo de INT96, así que conocer el productor te ayuda a explicar comportamientos extraños o decidir si conviene reexportar con una versión más reciente. También confirma la procedencia cuando te entregan un archivo sin contexto, indicando si proviene de Spark, DuckDB, Polars o un script de pandas. Este visor muestra created_by directamente en el Resumen del Archivo, junto a la versión del formato y el códec de compresión, para que puedas revisar quién escribió el archivo antes de incorporarlo a un pipeline. Sube un archivo .parquet arriba para leer su cadena created_by.

¿Qué códecs de compresión admite Parquet y cómo compruebo cuál usa un archivo?

Parquet comprime cada bloque de columna de forma independiente, y el formato define varios códecs: UNCOMPRESSED, SNAPPY, GZIP, LZO, BROTLI, LZ4, ZSTD y LZ4_RAW. SNAPPY es un valor por defecto habitual porque equilibra velocidad y ratio de compresión, mientras que ZSTD suele generar archivos más pequeños a un costo de CPU moderado. El códec queda registrado en los metadatos de cada columna dentro del footer, así que no necesitas descomprimir nada para averiguar cuál se usó. Conocer el códec importa porque un lector que no soporte, por ejemplo, BROTLI o LZ4_RAW no podrá abrir el archivo, y un códec inesperado puede inflar o reducir el almacenamiento sin que lo notes. Este visor lee el códec desde el footer y lo muestra en el Resumen del Archivo como una etiqueta. Sube tu archivo arriba para confirmar su compresión antes de que un job dependa de ello.

¿Cómo leo realmente los valores de las filas de un archivo Parquet después de revisar aquí su esquema?

Este visor inspecciona metadatos en lugar de volcar valores de celda, lo que mantiene el análisis del footer rápido y ligero. Para leer las filas en sí necesitas un decodificador Parquet completo, así que la herramienta ofrece fragmentos de código listos para copiar en tres entornos habituales. En Python, pandas lee un archivo en una línea con pd.read_parquet, la vía habitual para analistas. En Node.js, el lector parquetjs-lite transmite los registros mediante un cursor. Con DuckDB-WASM puedes ejecutar SQL como read_parquet('your_file.parquet') directamente en el navegador, sin necesidad de servidor. Cada fragmento es un punto de partida funcional: cópialo, apúntalo a tu archivo y ajústalo desde ahí. El flujo recomendado es revisar aquí primero el esquema, los tipos y el número de filas, y luego tomar el fragmento que coincida con tu stack. Sube un archivo arriba, revisa la estructura y luego copia el código que se ajuste a tu flujo de trabajo.

Acerca del Visor de Archivos Parquet

El Visor de Archivos Parquet es una herramienta gratuita para inspeccionar la estructura de un archivo Apache Parquet sin escribir una sola línea de código. Sube un archivo .parquet y la herramienta lee los metadatos del footer del archivo para mostrarte el esquema, el número de filas, los row groups, el códec de compresión y cualquier metadato clave-valor incrustado. Está pensada para ingenieros de datos, analistas y desarrolladores que reciben un archivo Parquet y necesitan responder una pregunta rápida — qué columnas contiene, cuántas filas tiene y con qué herramienta se generó — antes de incorporarlo a un pipeline o notebook.

Todo ocurre en tu navegador. El archivo se lee con el FileReader del navegador y se procesa localmente, así que tus datos nunca salen de tu dispositivo: no hay subida a un servidor, no se necesita cuenta y no existe un límite de tamaño impuesto externamente. Esto es clave cuando el archivo contiene registros de clientes, datos financieros o cualquier información que no pegarías en una web cualquiera.

Qué lee el visor de un archivo Parquet

Parquet almacena sus metadatos en un footer codificado en Thrift al final del archivo, delimitado por los bytes mágicos PAR1 tanto al inicio como al final. El visor localiza ese footer y lo decodifica en un resumen legible:

  • Resumen del archivo — tamaño total del archivo, número total de filas, cantidad de row groups y número de columnas hoja, mostrados como un resumen rápido.
  • Detalles de formato — la versión del formato Parquet, la cadena created_by (la herramienta que generó el archivo, como una versión concreta de Arrow o parquet-mr) y el códec de compresión.
  • Esquema — cada columna hoja con su nombre, tipo físico y repetición. Los tipos físicos incluyen BOOLEAN, INT32, INT64, INT96, FLOAT, DOUBLE, BYTE_ARRAY y FIXED_LEN_BYTE_ARRAY. La repetición puede ser REQUIRED, OPTIONAL o REPEATED, lo que indica si una columna admite nulos o contiene valores repetidos.
  • Row groups — un desglose por grupo con número de filas, tamaño en disco y cantidad de columnas, para ver cómo se particionó internamente el archivo.
  • Metadatos clave-valor — cualquier metadato personalizado incrustado por la herramienta que escribió el archivo, que a menudo incluye el esquema de Arrow o notas específicas del framework.

Los códecs de compresión reconocidos incluyen UNCOMPRESSED, SNAPPY, GZIP, LZO, BROTLI, LZ4, ZSTD y LZ4_RAW.

Leer los datos reales de las filas

Este visor inspecciona metadatos, no valores de celda — no vuelca las filas. Es una decisión deliberada: analizar el footer es rápido y ligero, mientras que leer los datos completos de las filas requiere un decodificador Parquet completo. Para obtener los valores en sí, la herramienta te ofrece fragmentos de código listos para copiar en tres entornos habituales:

  • Python con pandas (pd.read_parquet), la vía más común para analistas.
  • Node.js usando el lector parquetjs-lite.
  • DuckDB-WASM, que puede consultar un archivo Parquet con SQL directamente en el navegador mediante read_parquet('file.parquet').

Copia el fragmento, apúntalo a tu archivo y en segundos tendrás un punto de partida funcional.

Por qué conviene revisar primero los metadatos de Parquet

Apache Parquet es un formato de almacenamiento columnar diseñado para analítica y cargas de big data. En lugar de almacenar los datos fila por fila, agrupa cada columna, lo que hace la compresión mucho más efectiva y permite que los motores de consulta omitan columnas y row groups que no necesitan — una técnica llamada predicate pushdown. Como el esquema y las estadísticas viven en el footer, una herramienta puede describir un archivo de varios gigabytes casi al instante, sin necesidad de escanearlo.

Revisar primero los metadatos ahorra tiempo real. Puedes confirmar que una columna se escribió con el tipo esperado, detectar un códec inesperado antes de que falle un job, verificar que el número de filas coincide con lo que debería haber producido una exportación previa, o leer el campo created_by para averiguar con qué herramienta se generó un archivo que te han entregado. Para cualquiera que esté depurando un pipeline de datos, esas respuestas suelen llegar antes de abrir las filas.

Sube un archivo .parquet arriba para ver su esquema y estructura, y luego toma un fragmento de código si necesitas leer las filas en sí.