OCR — Image to Text

Extract text from images, screenshots, and scanned documents free in your browser. No upload — text recognition runs entirely on your device via WebAssembly.

अपडेट किया गया

Share:
Home/Image Tools/OCR — Image to Text

OCR — Image to Text

Extract text from images and scanned documents. Runs entirely in your browser via WebAssembly — your image is never uploaded to a server.

Extract Text From an Image

Click or drag an image here

Photos, screenshots, or scanned documents

Privacy first: your image is never uploaded — text recognition runs entirely in your browser via WebAssembly. The one-time language-pack download (a few MB, cached after first use) is the only network request this tool makes.

अक्सर पूछे जाने वाले प्रश्न

Is my image uploaded to a server?

No. Text recognition runs entirely in your browser using WebAssembly (the tesseract.js OCR engine). The image itself never leaves your device. The only network request is a one-time download of the language pack the first time you use a given language — after that, your browser caches it and no further requests are made.

Which languages are supported?

The tool ships with a curated set of common languages — English, Spanish, French, German, Portuguese, Italian, Hindi, Chinese (Simplified), Japanese, Arabic, and Russian. Pick the language that matches the text in your image before extracting for the best accuracy.

Why is the extracted text sometimes wrong?

OCR accuracy depends heavily on image quality. Low resolution, blurry photos, low contrast, skewed angles, and handwriting all reduce accuracy. For best results, use a well-lit, high-resolution, straight-on photo or screenshot of printed text, and check the confidence score shown after extraction.

Can I edit the extracted text?

Yes. The output appears in an editable text box, so you can correct any recognition errors before copying or downloading it as a .txt file.

क्या यह टूल हस्तलिखित (handwritten) टेक्स्ट पढ़ सकता है?

बहुत साफ़-सुथरी और अलग-अलग स्पष्ट रूप से लिखी हुई हैंडराइटिंग के लिए यह संभव है, लेकिन इस टूल के पीछे चलने वाला OCR इंजन Tesseract मुख्य रूप से प्रिंटेड और टाइप किए गए टेक्स्ट पर ट्रेंड किया गया है, न कि हैंडराइटिंग पर, इसलिए हस्तलिखित नोट्स पर एक्यूरेसी किसी प्रिंटेड पेज या टाइप किए गए स्क्रीनशॉट की तुलना में साफ़ तौर पर कम और कम अनुमानित (less predictable) होती है। कर्सिव या जुड़ी हुई हैंडराइटिंग खास तौर पर मुश्किल होती है, क्योंकि इंजन का कैरेक्टर सेगमेंटेशन स्टेप उम्मीद करता है कि अक्षरों के बीच साफ़ गैप हो। अगर आपको नियमित रूप से हस्तलिखित नोट्स को डिजिटाइज़ करना है, तो एक्सट्रैक्शन के बाद एडिटेबल टेक्स्ट बॉक्स में आपको एक प्रिंटेड डॉक्यूमेंट, रसीद, या स्कैन किए गए फॉर्म की तुलना में ज़्यादा मैन्युअल सुधार करना पड़ेगा। असल में हैंडराइटिंग पर केंद्रित पहचान के लिए, इस जैसे सामान्य-उद्देश्य वाले प्रिंटेड-टेक्स्ट इंजन की तुलना में एक विशेष हैंडराइटिंग-OCR मॉडल कहीं बेहतर प्रदर्शन करेगा।

पहला एक्सट्रैक्शन बाद वाले एक्सट्रैक्शन से ज़्यादा समय क्यों लेता है?

जब आप इस टूल पर किसी भाषा को पहली बार इस्तेमाल करते हैं, तो आपके ब्राउज़र को उस भाषा का ट्रेंड रिकग्निशन डेटा — आमतौर पर कुछ मेगाबाइट्स — एक CDN से डाउनलोड करना पड़ता है, तभी Tesseract उसमें टेक्स्ट पहचानना शुरू कर पाता है। यह डाउनलोड सिर्फ़ एक बार होता है; उसके बाद ब्राउज़र फ़ाइल को कैश कर लेता है, इसलिए उसी भाषा का इस्तेमाल करने वाला हर आगे का एक्सट्रैक्शन लगभग तुरंत शुरू होता है, बिना किसी और नेटवर्क एक्टिविटी के। किसी दूसरी भाषा पर पहली बार स्विच करने से उस भाषा के लिए एक और वन-टाइम डाउनलोड शुरू होता है। अगर आपका पहला एक्सट्रैक्शन धीमा लगे, तो यह सिर्फ़ यह शुरुआती सेटअप लागत है, कुछ गलत होने का संकेत नहीं — और यह इस टूल का इकलौता नेटवर्क रिक्वेस्ट है, क्योंकि इमेज को खुद प्रोसेस किया जाता है और कभी अपलोड नहीं किया जाता।

क्या यह OCR टूल रसीदों और साइनबोर्ड की फोटो पर काम करता है, न कि सिर्फ़ स्कैन किए गए डॉक्यूमेंट पर?

हां — यह सिर्फ़ फ्लैटबेड-स्टाइल स्कैन तक सीमित नहीं है। रसीदों, स्ट्रीट साइन, रेस्टोरेंट मेन्यू, प्रोडक्ट लेबल, और व्हाइटबोर्ड की फोटो, ये सभी काम करती हैं, बशर्ते टेक्स्ट कैमरे के हिसाब से ठीक-ठाक फोकस में हो, बराबर रोशनी वाला हो, और ज़्यादा तिरछा न हो। असली दुनिया की फोटो आमतौर पर एक साफ़ डिजिटल स्कैन की तुलना में कॉन्फिडेंस मेट्रिक पर कम स्कोर करती हैं, क्योंकि इनमें कुछ ऐसे वेरिएबल आ जाते हैं जो स्कैनर में नहीं होते — छाया, चमक (glare), झुर्रीदार रसीद जैसी घुमावदार सतहें, और शूटिंग एंगल से आने वाली परस्पेक्टिव विकृति। फोटो खींचने से पहले रसीद को समतल करना, ऊपर की लाइट से सीधी चमक (glare) से बचना, और कैमरे को सतह के जितना हो सके समानांतर रखना — ये सब इस तरह के रोज़मर्रा, गैर-डॉक्यूमेंट टेक्स्ट पर नतीजों को मापने लायक तरीके से बेहतर बनाते हैं।

यह टूल किन इमेज फॉर्मेट और फ़ाइल साइज़ को स्वीकार करता है?

कोई भी आम इमेज फॉर्मेट जिसे आपका ब्राउज़र दिखा सकता है, काम करता है, जिसमें JPG, PNG, WebP, और BMP शामिल हैं — टूल वही स्वीकार करता है जो आप स्टैंडर्ड इमेज फ़ाइल के रूप में सिलेक्ट या ड्रैग करके डालते हैं। यहां किसी सर्वर-साइड अपलोड लिमिट की चिंता नहीं है क्योंकि कुछ भी अपलोड नहीं होता, लेकिन बहुत बड़ी, हाई-रिज़ॉल्यूशन इमेज को प्रोसेस होने में ज़्यादा समय लगता है, क्योंकि रिकग्निशन आपकी डिवाइस के अपने प्रोसेसर पर चलता है, और बेहद बड़ी फ़ाइलों को ब्राउज़र में लोड होने में भी शुरुआत में ज़्यादा समय लग सकता है। ज़्यादातर रोज़मर्रा के इस्तेमाल के लिए — स्क्रीनशॉट, फोन से खींची फोटो, सिंगल-पेज स्कैन — फ़ाइल साइज़ कोई व्यावहारिक चिंता नहीं है; यह सिर्फ़ असामान्य रूप से बड़ी, हाई-मेगापिक्सल इमेज के लिए ही मायने रखता है।

क्या मैं एक ही इमेज से एक से ज़्यादा भाषाओं में टेक्स्ट निकाल सकता हूं?

एक ही पास में नहीं — आप एक्सट्रैक्ट करने से पहले एक भाषा चुनते हैं, और इंजन उसी भाषा के ट्रेंड किए गए कैरेक्टर और वर्ड पैटर्न का इस्तेमाल करके इमेज को समझता है। अगर किसी डॉक्यूमेंट में दो भाषाएं मिली-जुली हों (जैसे, किसी विदेशी-भाषा फॉर्म पर अंग्रेज़ी कैप्शन), तो वह भाषा चुनें जो आपको सबसे ज़्यादा चाहिए वाले टेक्स्ट में हावी है, क्योंकि इंजन अक्सर मिलती-जुलती लिपि (script) के अलग-अलग शब्दों को सही ढंग से पहचान लेता है, भले ही भाषा सेटिंग पूरी तरह मेल न खाए। ऐसे डॉक्यूमेंट के लिए जो सचमुच और काफ़ी हद तक अलग-अलग लिपियों के साथ द्विभाषी (bilingual) हो, आमतौर पर हर भाषा को अलग-अलग चुनकर दो बार एक्सट्रैक्शन चलाना और दोनों नतीजों की तुलना करना बेहतर रहता है।

संबंधित टूल

मुफ़्त ऑनलाइन इमेज रिसाइज़र

छवियों का आकार किसी भी आयाम में बदलें। आस्पेक्ट रेशियो बनाए रखें या कस्टम आकार सेट करें। मुफ़्त, तेज़ और पूरी तरह आपके ब्राउज़र में, बिना साइन-अप के।

मुफ़्त ऑनलाइन इमेज कंप्रेसर

गुणवत्ता खोए बिना फ़ाइल का आकार कम करने के लिए छवियों को कंप्रेस करें। मुफ़्त, तेज़ और पूरी तरह आपके ब्राउज़र में, बिना साइन-अप के।

मुफ़्त ऑनलाइन इमेज क्रॉपर

विज़ुअल एडिटर से छवियों को किसी भी आकार या आस्पेक्ट रेशियो में क्रॉप करें। मुफ़्त, तेज़ और पूरी तरह आपके ब्राउज़र में, बिना साइन-अप के।

मुफ़्त Favicon जनरेटर

एक ही छवि से सभी आकारों में favicon बनाएं। मुफ़्त, तेज़ और पूरी तरह आपके ब्राउज़र में, बिना साइन-अप के।

OCR — Image to Text टूल के बारे में

ऑप्टिकल कैरेक्टर रिकग्निशन (OCR) एक बहुत ही आम समस्या हल करता है: आपके पास किसी इमेज के अंदर फंसा हुआ टेक्स्ट है — एक स्क्रीनशॉट, किसी पेज की फोटो, या स्कैन किया हुआ फॉर्म — और आपको उसे असली, सिलेक्ट और एडिट किए जा सकने वाले टेक्स्ट के रूप में चाहिए, न कि टेक्स्ट की तस्वीर के रूप में। यह टूल वह टेक्स्ट सीधे आपके ब्राउज़र में एक्सट्रैक्ट करता है, और कुछ भी कभी आपकी डिवाइस से बाहर नहीं जाता।

OCR असल में काम कैसे करता है

बड़े स्तर पर देखें तो, एक OCR इंजन किसी इमेज को देखता है, उन हिस्सों की पहचान करता है जो टेक्स्ट जैसे दिखते हैं, फिर उन हिस्सों को लाइनों और अलग-अलग कैरेक्टर में बांटता है, और उसके बाद हर कैरेक्टर के आकार को उन पैटर्न से मिलाकर पहचानता है जो उसने ट्रेनिंग के दौरान सीखे थे। यह टूल Tesseract पर चलता है, जो एक OCR इंजन है जिसे मूल रूप से 1980 के दशक में Hewlett-Packard में विकसित किया गया था, 2005 में ओपन सोर्स के रूप में जारी किया गया, और तब से Google द्वारा मेंटेन किया जा रहा है — यह उपलब्ध सबसे ज़्यादा इस्तेमाल किए जाने वाले और अच्छी तरह से टेस्ट किए गए OCR इंजनों में से एक है, जो अनगिनत स्कैनिंग ऐप्स और डॉक्यूमेंट पाइपलाइनों में इस्तेमाल होता है। यहां इस्तेमाल किया गया खास वर्जन, tesseract.js, एक WebAssembly पोर्ट है जो उसी रिकग्निशन इंजन को चलाता है जो सामान्यतः एक नेटिव प्रोग्राम के रूप में चलता है, लेकिन इसे इस तरह कंपाइल किया गया है कि यह वेब ब्राउज़र के अंदर लगभग नेटिव जितनी स्पीड पर चले, बिना किसी सर्वर राउंड-ट्रिप की ज़रूरत के।

टेक्स्ट एक्सट्रैक्ट करते समय क्या होता है

जब आप कोई इमेज अपलोड करते हैं, तो ब्राउज़र फ़ाइल को लोकली पढ़ता है और उसे बैकग्राउंड थ्रेड (एक Web Worker) में चल रहे OCR इंजन को सौंप देता है, ताकि रिकग्निशन के दौरान पेज रिस्पॉन्सिव बना रहे। इंजन को अपना काम करने के लिए दो चीज़ें चाहिए होती हैं: कोर रिकग्निशन कोड, और आपके चुने गए भाषा के लिए एक ट्रेंड लैंग्वेज मॉडल — अंग्रेज़ी, स्पेनिश, फ्रेंच और कई अन्य भाषाएं उपलब्ध हैं। जब आप किसी भाषा को पहली बार इस्तेमाल करते हैं, तो आपका ब्राउज़र उस भाषा का ट्रेंड डेटा (कुछ मेगाबाइट्स) एक पब्लिक CDN से डाउनलोड करता है; उसके बाद ब्राउज़र उसे कैश कर लेता है, इसलिए आगे के एक्सट्रैक्शन — यहां तक कि किसी दूसरे टैब या सेशन में भी — दोबारा कुछ भी डाउनलोड करने की ज़रूरत नहीं होती। यह इस टूल का इकलौता नेटवर्क रिक्वेस्ट है; जिस इमेज से आप टेक्स्ट निकाल रहे हैं, वह कभी कहीं नहीं भेजी जाती।

कॉन्फिडेंस स्कोर को समझना

एक्सट्रैक्शन के बाद, टूल पहचाने गए टेक्स्ट के साथ एक कॉन्फिडेंस पर्सेंटेज बताता है। यह नंबर दिखाता है कि इंजन को अपने ही आउटपुट पर कितना भरोसा है, यह उन सभी कैरेक्टर का औसत होता है जिन्हें उसने पहचाना — यह सही होने की गारंटी नहीं है, लेकिन यह एक उपयोगी संकेत है कि नतीजे को कितनी मैन्युअल जांच की ज़रूरत है। ज़्यादा कॉन्फिडेंस (80%+) आमतौर पर एक साफ़, अच्छी रोशनी वाली, सीधी सोर्स इमेज को दिखाता है जिसमें प्रिंटेड टेक्स्ट हो। कम स्कोर आमतौर पर धुंधली फोटो, टेक्स्ट और बैकग्राउंड के बीच कम कंट्रास्ट, तिरछे या घुमे हुए पेज, अनोखे फॉन्ट, या हस्तलिखित टेक्स्ट के साथ दिखते हैं, जिसके लिए Tesseract खास तौर पर नहीं बनाया गया — यह मुख्य रूप से प्रिंटेड, टाइप किए गए टेक्स्ट पर बनाया और ट्रेंड किया गया है।

बेहतर नतीजे कैसे पाएं

कुछ आदतें एक्यूरेसी को साफ़ तौर पर बेहतर बनाती हैं: सोर्स को तिरछे कोण से नहीं बल्कि जितना हो सके सीधा फोटो खींचें या स्कैन करें, तेज़ छाया या चमक (glare) के बिना अच्छी और बराबर रोशनी का इस्तेमाल करें, और अपने कैमरे का फोकस जितना पास तक जाने दे उतने पास से टेक्स्ट की फोटो लें, ताकि कैरेक्टर कुछ पिक्सल की धुंधली आकृति न बनकर रह जाएं। अपलोड करने से पहले बड़े, अप्रासंगिक बैकग्राउंड हिस्सों को क्रॉप करना भी मदद करता है, क्योंकि इससे इंजन को टेक्स्ट वाले हिस्सों को शोर से अलग करने में कम मेहनत करनी पड़ती है। अगर किसी फोटो का कॉन्फिडेंस कम आता है, तो बेहतर रोशनी या ज़्यादा स्थिर हाथ से दोबारा फोटो लेना, उसी खराब सोर्स इमेज को दोबारा प्रोसेस करने से कहीं ज़्यादा असरदार होता है।

यह पूरी तरह आपके ब्राउज़र में ही क्यों चलता है

पारंपरिक OCR टूल आपकी इमेज को प्रोसेसिंग के लिए एक सर्वर पर अपलोड करते हैं, जिसका मतलब है कि निजी, संवेदनशील, या गोपनीय टेक्स्ट वाला कोई डॉक्यूमेंट — एक कॉन्ट्रैक्ट, कोई मेडिकल फॉर्म, एक आईडी कार्ड — ऐसे इन्फ्रास्ट्रक्चर से होकर गुज़रता है जो आपके नियंत्रण में नहीं होता। Tesseract को WebAssembly में कंपाइल करके चलाने से यह समस्या पूरी तरह टल जाती है: रिकग्निशन आपकी अपनी डिवाइस पर, आपके अपने CPU का इस्तेमाल करके होता है, इसलिए इमेज की सामग्री के बारे में कुछ भी कभी ट्रांसमिट, लॉग या स्टोर नहीं होता, वह भी आपके ब्राउज़र टैब से बाहर कहीं भी नहीं।