मुफ़्त Parquet फ़ाइल व्यूअर

अपने ब्राउज़र में Apache Parquet फ़ाइल मेटाडेटा का निरीक्षण करें। schema, रो काउंट, कॉलम आँकड़े और फ़ाइल संरचना देखें। मुफ़्त, तेज़ और पूरी तरह आपके ब्राउज़र में काम करता है, बिना साइन-अप के।

अपडेट किया गया

Share:
Home/Utility Tools/Parquet File Viewer

Parquet File Viewer

Inspect Apache Parquet file metadata, schema, and structure in your browser.

Parquet File Viewer

Read Row Data with Code

Full row data reading requires a Parquet library. Here are code snippets for common environments:

import pandas as pd

# Read a Parquet file
df = pd.read_parquet('your_file.parquet')
print(df.head())
print(df.dtypes)

About Apache Parquet

Apache Parquet is a columnar storage format designed for big data workloads. It stores data column-by-column rather than row-by-row, enabling efficient compression and predicate pushdown.

Files begin and end with the magic bytes PAR1. File metadata is Thrift-encoded and stored in the footer before the trailing magic.

अक्सर पूछे जाने वाले प्रश्न

Parquet File Viewer क्या है?

Parquet File Viewer एक मुफ़्त ऑनलाइन टूल है जो आपके ब्राउज़र में Apache Parquet फ़ाइल के मेटाडेटा की जाँच करता है। स्कीमा, पंक्तियों की संख्या, कॉलम के आँकड़े और फ़ाइल संरचना देखें। यह पूरी तरह आपके ब्राउज़र में चलता है, बिना किसी इंस्टॉलेशन या साइन-अप के।

मैं कौन-सी जानकारी देख सकता हूँ?

फ़ाइल स्कीमा, कॉलम प्रकार, रो ग्रुप की संख्या, कुल पंक्तियाँ, कंप्रेशन कोडेक और कॉलम के आँकड़े (न्यूनतम/अधिकतम)।

क्या मैं पंक्ति डेटा देख सकता हूँ?

मेटाडेटा सीधे दिखाया जाता है। पूरी पंक्ति डेटा के लिए टूल Python, Node.js और DuckDB-WASM के लिए कोड स्निपेट प्रदान करता है।

क्या यह मुफ़्त है?

हाँ, पूरी तरह मुफ़्त।

क्या Parquet File Viewer मोबाइल उपकरणों पर काम करता है?

हाँ, Parquet File Viewer पूरी तरह रिस्पॉन्सिव है और स्मार्टफ़ोन व टैबलेट पर काम करता है। आप इसे किसी भी आधुनिक वेब ब्राउज़र वाले डिवाइस पर इस्तेमाल कर सकते हैं — किसी ऐप डाउनलोड की ज़रूरत नहीं।

क्या इस टूल का उपयोग करने के लिए मुझे खाता बनाना होगा?

किसी खाते या पंजीकरण की ज़रूरत नहीं है। बस अपने ब्राउज़र में Parquet File Viewer खोलें और तुरंत इस्तेमाल शुरू करें। कोई साइन-अप दीवार या उपयोग प्रतिबंध नहीं है।

मैं Parquet File Viewer का उपयोग कैसे करूँ?

बस दिए गए फ़ील्ड में अपना इनपुट दर्ज करें, अपनी पसंद के अनुसार सेटिंग्स समायोजित करें, और टूल इसे तुरंत प्रोसेस कर देगा। फिर आप परिणाम को क्लिपबोर्ड पर कॉपी कर सकते हैं या डाउनलोड कर सकते हैं।

कौन-से ब्राउज़र समर्थित हैं?

Parquet File Viewer सभी आधुनिक ब्राउज़रों में काम करता है, जिनमें Chrome, Firefox, Safari, Edge और Opera शामिल हैं। बेहतरीन अनुभव के लिए अपने पसंदीदा ब्राउज़र का नवीनतम संस्करण इस्तेमाल करें।

एक Parquet viewer बिना पूरी फ़ाइल पढ़े किसी बड़ी फ़ाइल का स्कीमा और row count तुरंत कैसे दिखा देता है?

Parquet अपनी संरचनात्मक जानकारी फ़ाइल के बिल्कुल अंत में एक Thrift-encoded फ़ुटर में स्टोर करता है, जिसे शुरुआत और अंत दोनों जगह PAR1 मैजिक बाइट्स से फ्रेम किया जाता है। उस फ़ुटर में स्कीमा, कुल row count, row-group की सीमाएं, कम्प्रेशन कोडेक, और कोई भी एम्बेडेड key-value मेटाडेटा होता है। चूंकि यह सब एक ही कॉम्पैक्ट ब्लॉक में मौजूद होता है, viewer को सिर्फ़ फ़ुटर की लंबाई पढ़नी होती है, फ़ुटर तक जाना होता है, और उसे डिकोड करना होता है — गीगाबाइट्स के column डेटा को स्कैन करने की ज़रूरत नहीं पड़ती। यही वजह है कि एक multi-gigabyte फ़ाइल खुद को लगभग उतनी ही तेज़ी से बताती है जितना एक छोटी फ़ाइल, और इसी वजह से आप किसी भारी प्रोसेसिंग से पहले संरचना का sanity-check कर सकते हैं। यह टूल उस फ़ुटर को आपके ब्राउज़र में ही लोकल रूप से पढ़ता है, इसलिए बड़ी फ़ाइलें भी सेकंडों में अपना स्कीमा और संरचना दिखा देती हैं। ऊपर एक .parquet फ़ाइल डालें और बिना एक भी row डेटा खोले पूरा ओवरव्यू देखें।

Parquet row group और column में क्या फ़र्क़ है?

एक column आपके स्कीमा में एक फ़ील्ड होता है, जैसे user_id या created_at, जिसे उसकी सारी वैल्यूज़ के साथ एक साथ स्टोर किया जाता है ताकि कम्प्रेशन तेज़ हो और column pruning संभव हो सके। एक row group पूरी टेबल का एक क्षैतिज (horizontal) टुकड़ा होता है: यह हर column में से rows का एक हिस्सा लेकर उसे अपने खुद के स्टैटिस्टिक्स और डिस्क साइज़ वाली एक स्वयं-निहित यूनिट में बांधता है। दस लाख rows वाली कोई फ़ाइल उन्हें कई row groups में बांट सकती है, और हर group फिर भी सभी columns रखता है। Row groups क्वेरी इंजन को min और max स्टैटिस्टिक्स की मदद से पूरे ब्लॉक्स स्किप करने देते हैं, जिससे predicate pushdown असरदार बनता है। यह viewer दोनों नज़रिए दिखाता है: एक Schema टैब जो हर leaf column को उसके टाइप के साथ लिस्ट करता है, और एक Row Groups टैब जो प्रति-group row count और साइज़ दिखाता है। अपनी फ़ाइल के column लेआउट की तुलना उसके row-group विभाजन से करने के लिए ऊपर फ़ाइल अपलोड करें।

किसी Parquet फ़ाइल में created_by फ़ील्ड मुझे क्या बताती है?

created_by स्ट्रिंग यह दर्ज करती है कि फ़ाइल किस लाइब्रेरी और वर्ज़न ने लिखी थी, उदाहरण के लिए किसी खास parquet-mr, Arrow, या pandas रिलीज़ ने। यह फ़ॉर्मेट वर्ज़न के साथ फ़ुटर मेटाडेटा में ही स्टोर होती है। डीबगिंग के समय यह वाकई उपयोगी होती है: कुछ writers में स्टैटिस्टिक्स, timestamp एन्कोडिंग, या INT96 हैंडलिंग को लेकर जानी-मानी खामियां होती हैं, इसलिए producer का पता होने से आप अजीब व्यवहार को समझ सकते हैं या यह तय कर सकते हैं कि किसी नए toolchain से दोबारा एक्सपोर्ट करना है या नहीं। जब कोई फ़ाइल बिना किसी संदर्भ के आपको दी जाती है, तो यह उसकी उत्पत्ति (provenance) की पुष्टि भी करती है — यानी बताती है कि यह Spark, DuckDB, Polars, या किसी pandas स्क्रिप्ट से आई है। यह viewer created_by को सीधे File Overview में, फ़ॉर्मेट वर्ज़न और कम्प्रेशन कोडेक के बगल में दिखाता है, ताकि आप फ़ाइल को pipeline में लोड करने से पहले writer की जांच कर सकें। अपनी .parquet फ़ाइल का created_by स्ट्रिंग पढ़ने के लिए ऊपर अपलोड करें।

Parquet किन कम्प्रेशन कोडेक्स को सपोर्ट करता है, और यह कैसे पता करें कि कोई फ़ाइल कौन-सा कोडेक इस्तेमाल करती है?

Parquet हर column chunk को स्वतंत्र रूप से कम्प्रेस करता है, और यह फ़ॉर्मेट कई कोडेक्स परिभाषित करता है: UNCOMPRESSED, SNAPPY, GZIP, LZO, BROTLI, LZ4, ZSTD, और LZ4_RAW। SNAPPY एक आम डिफ़ॉल्ट है क्योंकि यह स्पीड और कम्प्रेशन रेशियो के बीच संतुलन बनाता है, जबकि ZSTD अक्सर थोड़े ज़्यादा CPU खर्च पर छोटी फ़ाइलें देता है। कोडेक हर column के मेटाडेटा में फ़ुटर के अंदर दर्ज होता है, इसलिए यह पता लगाने के लिए आपको कुछ भी डीकम्प्रेस करने की ज़रूरत नहीं। कोडेक का पता होना इसलिए मायने रखता है क्योंकि जो reader BROTLI या LZ4_RAW जैसे कोडेक को सपोर्ट नहीं करता, वह फ़ाइल खोलने में नाकाम हो जाएगा, और कोई अनपेक्षित कोडेक चुपचाप स्टोरेज को बढ़ा या घटा सकता है। यह viewer फ़ुटर से कोडेक पढ़ता है और उसे File Overview में एक बैज के रूप में दिखाता है। किसी job के इस पर निर्भर होने से पहले अपनी फ़ाइल का कम्प्रेशन जांचने के लिए ऊपर फ़ाइल अपलोड करें।

यहां स्कीमा जांचने के बाद मैं Parquet फ़ाइल से असली row values कैसे पढ़ूं?

यह viewer cell values दिखाने के बजाय मेटाडेटा जांचता है, जिससे फ़ुटर पार्सिंग तेज़ और हल्की बनी रहती है। असली rows पढ़ने के लिए आपको एक संपूर्ण Parquet डिकोडर चाहिए होता है, इसलिए यह टूल तीन आम environments के लिए तैयार-से-कॉपी कोड स्निपेट्स देता है। Python में, pandas एक ही लाइन में pd.read_parquet से फ़ाइल पढ़ लेता है, जो एनालिस्ट्स के लिए सामान्य तरीका है। Node.js में, parquetjs-lite रीडर एक कर्सर के ज़रिए रिकॉर्ड्स को स्ट्रीम करता है। DuckDB-WASM के साथ आप सीधे ब्राउज़र में read_parquet('your_file.parquet') जैसा SQL चला सकते हैं, किसी सर्वर की ज़रूरत नहीं। हर स्निपेट एक काम करने लायक शुरुआती बिंदु है: उसे कॉपी करें, अपनी फ़ाइल की ओर इशारा करें, और वहां से आगे बदलाव करें। सुझाई गई प्रक्रिया यह है कि पहले यहां स्कीमा, टाइप्स, और row count जांच लें, फिर अपने स्टैक से मेल खाने वाला स्निपेट लें। ऊपर एक फ़ाइल अपलोड करें, संरचना की समीक्षा करें, फिर अपने वर्कफ़्लो के अनुसार कोड कॉपी करें।

संबंधित टूल

मुफ़्त सुरक्षित पासवर्ड जनरेटर

अनुकूलन योग्य विकल्पों के साथ सुरक्षित, यादृच्छिक पासवर्ड बनाएं। मुफ़्त, तेज़ और पूरी तरह आपके ब्राउज़र में काम करता है, बिना साइन-अप के।

मुफ़्त UUID/GUID जनरेटर

सार्वभौमिक रूप से अद्वितीय पहचानकर्ता (UUID/GUID) बनाएं। मुफ़्त, तेज़ और पूरी तरह आपके ब्राउज़र में काम करता है, बिना साइन-अप के।

मुफ़्त QR कोड जनरेटर ऑनलाइन

URL, टेक्स्ट, WiFi क्रेडेंशियल और बहुत कुछ के लिए QR कोड बनाएं। मुफ़्त, तेज़ और पूरी तरह आपके ब्राउज़र में काम करता है, बिना साइन-अप के।

मुफ़्त JSON फ़ॉर्मेटर और वैलिडेटर

सिंटैक्स हाइलाइटिंग और त्रुटि पहचान के साथ JSON डेटा को फ़ॉर्मेट, सत्यापित और सुंदर बनाएं। मुफ़्त, तेज़ और पूरी तरह आपके ब्राउज़र में काम करता है, बिना साइन-अप के।

Parquet File Viewer के बारे में

Parquet File Viewer एक मुफ़्त टूल है जो बिना एक लाइन कोड लिखे किसी Apache Parquet फ़ाइल की संरचना जांचने में आपकी मदद करता है। कोई .parquet फ़ाइल डालते ही यह फ़ाइल के फ़ुटर मेटाडेटा को पढ़कर आपको स्कीमा, row count, row groups, कम्प्रेशन कोडेक, और उसमें एम्बेड किया गया कोई भी key-value मेटाडेटा दिखा देता है। यह उन डेटा इंजीनियरों, एनालिस्ट्स और डेवलपर्स के लिए बनाया गया है जिन्हें कोई Parquet फ़ाइल मिलती है और जिन्हें pipeline या notebook में लोड करने से पहले एक झटपट सवाल का जवाब चाहिए होता है — इसमें कौन-कौन से columns हैं, कितनी rows हैं, और यह किस तरह लिखी गई थी

यह सब कुछ आपके ब्राउज़र में ही होता है। फ़ाइल को ब्राउज़र के FileReader से पढ़ा और लोकल रूप से पार्स किया जाता है, इसलिए आपका डेटा कभी भी आपकी डिवाइस से बाहर नहीं जाता — न कोई अपलोड, न कोई अकाउंट, और न ही सर्वर की तरफ़ से थोपी गई कोई साइज़ लिमिट। यह तब बहुत मायने रखता है जब फ़ाइल में customer records, फाइनेंशियल डेटा, या ऐसी कोई भी जानकारी हो जिसे आप किसी अनजान वेबसाइट पर पेस्ट नहीं करना चाहेंगे।

Viewer किसी Parquet फ़ाइल से क्या-क्या पढ़ता है

Parquet अपना मेटाडेटा फ़ाइल के अंत में एक Thrift-encoded फ़ुटर में स्टोर करता है, जिसे शुरुआत और अंत दोनों जगह PAR1 मैजिक बाइट्स से फ्रेम किया जाता है। Viewer उस फ़ुटर को ढूंढता है और उसे एक पढ़ने-लायक ओवरव्यू में डिकोड करता है:

  • File overview — कुल फ़ाइल साइज़, कुल row count, row groups की संख्या, और leaf columns की संख्या, एक झटपट सारांश के रूप में दिखाई जाती है।
  • Format details — Parquet फॉर्मेट का वर्ज़न, created_by स्ट्रिंग (यानी फ़ाइल बनाने वाला writer, जैसे कोई खास Arrow या parquet-mr वर्ज़न), और कम्प्रेशन कोडेक।
  • Schema — हर leaf column का नाम, फ़िज़िकल टाइप, और repetition। फ़िज़िकल टाइप्स में BOOLEAN, INT32, INT64, INT96, FLOAT, DOUBLE, BYTE_ARRAY, और FIXED_LEN_BYTE_ARRAY शामिल हैं। Repetition REQUIRED, OPTIONAL, या REPEATED में से एक होती है, जो बताती है कि कोई column nulls की अनुमति देता है या दोहराए गए (repeated) मान रखता है।
  • Row groups — प्रत्येक group का row count, डिस्क पर साइज़, और column count का ब्रेकडाउन, ताकि आप देख सकें कि फ़ाइल आंतरिक रूप से किस तरह विभाजित (partition) की गई थी।
  • Key-value metadata — writer द्वारा एम्बेड किया गया कोई भी कस्टम मेटाडेटा, जिसमें अक्सर Arrow स्कीमा या फ्रेमवर्क-विशिष्ट नोट्स शामिल होते हैं।

पहचाने जाने वाले कम्प्रेशन कोडेक्स में UNCOMPRESSED, SNAPPY, GZIP, LZO, BROTLI, LZ4, ZSTD, और LZ4_RAW शामिल हैं।

असली row डेटा पढ़ना

यह viewer मेटाडेटा जांचता है, cell values नहीं दिखाता — यह rows को डंप नहीं करता। यह एक जानबूझकर किया गया ट्रेड-ऑफ़ है: फ़ुटर पार्स करना तेज़ और हल्का काम है, जबकि पूरा row डेटा पढ़ने के लिए एक संपूर्ण Parquet डिकोडर चाहिए होता है। असली values पाने के लिए, यह टूल आपको तीन आम माहौलों (environments) के लिए तैयार-से-कॉपी कोड स्निपेट्स देता है:

  • Python के साथ pandas (pd.read_parquet), जो एनालिस्ट्स के लिए सबसे आम तरीका है।
  • Node.js में parquetjs-lite रीडर का इस्तेमाल करके।
  • DuckDB-WASM, जो read_parquet('file.parquet') के ज़रिए सीधे ब्राउज़र में SQL से Parquet फ़ाइल को क्वेरी कर सकता है।

स्निपेट कॉपी करें, उसे अपनी फ़ाइल की ओर इशारा करें, और आपके पास कुछ ही सेकंड में एक काम करने लायक शुरुआती बिंदु तैयार होगा।

Parquet मेटाडेटा को पहले क्यों जांचना चाहिए

Apache Parquet एक कॉलमर स्टोरेज फॉर्मेट है जो analytics और big-data वर्कलोड के लिए बनाया गया है। डेटा को row-by-row स्टोर करने के बजाय, यह हर column को एक साथ स्टोर करता है, जिससे कम्प्रेशन कहीं ज़्यादा असरदार हो जाता है और क्वेरी इंजन उन columns और row groups को स्किप कर सकते हैं जिनकी उन्हें ज़रूरत नहीं — इस तकनीक को predicate pushdown कहा जाता है। चूंकि स्कीमा और स्टैटिस्टिक्स फ़ुटर में ही मौजूद होते हैं, कोई टूल बिना स्कैन किए ही एक multi-gigabyte फ़ाइल का वर्णन लगभग तुरंत कर सकता है।

पहले मेटाडेटा जांचने से वाकई समय बचता है। आप यह पुष्टि कर सकते हैं कि कोई column आपकी अपेक्षा के मुताबिक टाइप के साथ लिखा गया था, किसी job के फेल होने से पहले किसी अनपेक्षित कोडेक को पकड़ सकते हैं, upstream export से मिलनी चाहिए row count का sanity-check कर सकते हैं, या created_by फ़ील्ड पढ़कर पता लगा सकते हैं कि आपको दी गई फ़ाइल किस टूल ने बनाई थी। किसी डेटा pipeline को डीबग करने वाले किसी भी व्यक्ति के लिए, ये जवाब आमतौर पर rows खोलने से पहले ही मिल जाते हैं।

अपनी .parquet फ़ाइल का स्कीमा और संरचना देखने के लिए ऊपर अपलोड करें, और अगर आपको असली rows पढ़नी हों तो एक कोड स्निपेट ले लें।