OCR — Image to Text
Extract text from images, screenshots, and scanned documents free in your browser. No upload — text recognition runs entirely on your device via WebAssembly.
Actualizado
OCR — Image to Text
Extract text from images and scanned documents. Runs entirely in your browser via WebAssembly — your image is never uploaded to a server.
Extract Text From an Image
Click or drag an image here
Photos, screenshots, or scanned documents
Preguntas Frecuentes
Is my image uploaded to a server?
No. Text recognition runs entirely in your browser using WebAssembly (the tesseract.js OCR engine). The image itself never leaves your device. The only network request is a one-time download of the language pack the first time you use a given language — after that, your browser caches it and no further requests are made.
Which languages are supported?
The tool ships with a curated set of common languages — English, Spanish, French, German, Portuguese, Italian, Hindi, Chinese (Simplified), Japanese, Arabic, and Russian. Pick the language that matches the text in your image before extracting for the best accuracy.
Why is the extracted text sometimes wrong?
OCR accuracy depends heavily on image quality. Low resolution, blurry photos, low contrast, skewed angles, and handwriting all reduce accuracy. For best results, use a well-lit, high-resolution, straight-on photo or screenshot of printed text, and check the confidence score shown after extraction.
Can I edit the extracted text?
Yes. The output appears in an editable text box, so you can correct any recognition errors before copying or downloading it as a .txt file.
¿Puede esta herramienta leer texto manuscrito?
Es posible con una letra manuscrita muy clara y con caracteres bien separados, pero Tesseract —el motor de OCR detrás de esta herramienta— está entrenado principalmente con texto impreso y escrito a máquina, no con escritura a mano, por lo que la precisión en notas manuscritas es notablemente más baja e impredecible que en una página impresa o una captura de pantalla con texto tipeado. La letra cursiva o unida resulta especialmente difícil, ya que el paso de segmentación de caracteres del motor espera que las letras tengan espacios visibles entre sí. Si necesitas digitizar notas manuscritas con regularidad, cuenta con hacer más correcciones manuales en el cuadro de texto editable después de la extracción de las que harías con un documento impreso, un recibo o un formulario escaneado. Para un reconocimiento genuinamente enfocado en escritura a mano, un modelo de OCR especializado en manuscritos rendiría notablemente mejor que un motor de propósito general para texto impreso como este.
¿Por qué la primera extracción tarda más que las siguientes?
La primera vez que usas un idioma determinado en esta herramienta, tu navegador tiene que descargar desde una CDN los datos de reconocimiento entrenados para ese idioma —normalmente unos pocos megabytes— antes de que Tesseract pueda empezar a reconocer texto en él. Esa descarga ocurre una sola vez; el navegador guarda el archivo en caché después, así que cada extracción posterior con el mismo idioma comienza casi de inmediato, sin ninguna actividad de red adicional. Cambiar a otro idioma por primera vez desencadena una descarga única más, específica para ese idioma. Si tu primera extracción se siente lenta, se trata de este costo inicial de configuración, no de una señal de que algo falla —y es la única solicitud de red que hace esta herramienta, ya que la imagen en sí se procesa y nunca se sube a ningún servidor.
¿Esta herramienta de OCR funciona con fotos de recibos y carteles, o solo con documentos escaneados?
Sí —no se limita a escaneos tipo escáner plano—. Fotos de recibos, carteles de la calle, cartas de restaurante, etiquetas de productos y pizarras funcionan todas, siempre que el texto esté razonablemente enfocado, bien iluminado y no demasiado torcido respecto a la cámara. Las fotos del mundo real tienden a obtener una puntuación de confianza más baja que un escaneo digital limpio simplemente porque introducen variables que un escáner no tiene —sombras, reflejos, superficies curvas como un recibo arrugado y distorsión de perspectiva por el ángulo de la toma—. Aplanar un recibo antes de fotografiarlo, evitar el reflejo directo de luces cenitales y sostener la cámara lo más paralela posible a la superficie mejoran de forma medible los resultados en este tipo de texto cotidiano y no documental.
¿Qué formatos de imagen y tamaños de archivo acepta la herramienta?
Funciona cualquier formato de imagen común que tu navegador pueda mostrar, incluidos JPG, PNG, WebP y BMP —la herramienta acepta lo que selecciones o arrastres como archivo de imagen estándar—. No existe un límite de subida en el servidor del que preocuparse, ya que no se sube nada, pero las imágenes muy grandes y de alta resolución sí tardan más en procesarse porque el reconocimiento se ejecuta en el propio procesador de tu dispositivo, y los archivos extremadamente grandes pueden tardar más en cargarse en el navegador desde el principio. Para el uso cotidiano habitual —capturas de pantalla, fotos de teléfono, escaneos de una sola página— el tamaño del archivo no es una preocupación práctica; solo se vuelve relevante con imágenes inusualmente grandes y de muchos megapíxeles.
¿Puedo extraer texto en más de un idioma de la misma imagen?
No en una sola pasada —eliges un idioma antes de extraer, y el motor usa los patrones de caracteres y palabras entrenados de ese idioma para interpretar la imagen—. Si un documento mezcla dos idiomas (por ejemplo, subtítulos en inglés sobre un formulario en otro idioma), elige el idioma que predomine en el texto que más te interese, ya que el motor a menudo seguirá reconociendo correctamente palabras individuales superpuestas de una escritura similar aunque la configuración de idioma no coincida a la perfección. Para un documento genuina y sustancialmente bilingüe con escrituras distintas, normalmente obtendrás mejores resultados ejecutando la extracción dos veces, seleccionando cada idioma por separado y comparando ambos resultados.
Herramientas Relacionadas
Redimensionar Imágenes Online Gratis
Cambia el tamaño de imágenes a cualquier dimensión. Mantén la proporción o define medidas personalizadas. Gratis, rápido y funciona por completo en tu navegador sin registro.
Compresor de Imágenes Online Gratis
Comprime imágenes para reducir el tamaño del archivo sin perder calidad. Gratis, rápido y funciona por completo en tu navegador sin registro.
Recortar Imágenes Online Gratis
Recorta imágenes a cualquier tamaño o proporción con un editor visual. Gratis, rápido y funciona por completo en tu navegador sin registro.
Generador de Favicon Gratis
Genera favicons en todos los tamaños a partir de una sola imagen. Gratis, rápido y funciona por completo en tu navegador sin registro.
Acerca de la herramienta OCR — Imagen a Texto
El reconocimiento óptico de caracteres (OCR) resuelve un problema muy concreto y muy común: tienes texto atrapado dentro de una imagen —una captura de pantalla, una página fotografiada, un formulario escaneado— y necesitas convertirlo en texto real, seleccionable y editable, en lugar de en una simple imagen de texto. Esta herramienta extrae ese texto directamente en tu navegador, sin que nada salga nunca de tu dispositivo.
Cómo funciona realmente el OCR
A grandes rasgos, un motor de OCR analiza una imagen, identifica las regiones que parecen contener texto, segmenta esas regiones en líneas y caracteres individuales, y luego clasifica la forma de cada carácter comparándola con los patrones que aprendió durante su entrenamiento. Esta herramienta funciona sobre Tesseract, un motor de OCR desarrollado originalmente en Hewlett-Packard en los años 80, publicado como código abierto en 2005 y mantenido desde entonces por Google —es uno de los motores de OCR más utilizados y probados que existen, integrado en incontables aplicaciones de escaneo y flujos de procesamiento de documentos—. La versión concreta que se usa aquí, tesseract.js, es un port a WebAssembly que ejecuta el mismo motor de reconocimiento que normalmente corre como programa nativo, pero compilado para funcionar dentro de un navegador web a una velocidad cercana a la nativa, sin necesidad de ida y vuelta a ningún servidor.
Qué ocurre cuando extraes texto
Cuando subes una imagen, el navegador lee el archivo localmente y se lo entrega al motor de OCR, que se ejecuta en un hilo en segundo plano (un Web Worker), de modo que la página se mantiene receptiva durante el reconocimiento. El motor necesita dos cosas para hacer su trabajo: el código de reconocimiento base y un modelo de idioma entrenado para el idioma que elijas —inglés, español, francés y varios otros están disponibles—. La primera vez que utilizas un idioma determinado, tu navegador descarga los datos entrenados de ese idioma (unos pocos megabytes) desde una CDN pública; a partir de ahí, el navegador los guarda en caché, así que las extracciones posteriores —incluso en otra pestaña o sesión— no necesitan volver a descargar nada. Esta es la única solicitud de red que hace la herramienta; la imagen de la que estás extrayendo texto nunca se envía a ningún sitio.
Cómo interpretar el porcentaje de confianza
Tras la extracción, la herramienta muestra un porcentaje de confianza junto al texto reconocido. Esta cifra refleja cuán segura está el motor de su propio resultado, promediado entre todos los caracteres que identificó —no es una garantía de que el texto sea correcto, pero sí una señal útil de cuánta revisión manual merece el resultado—. Una confianza alta (80% o más) suele indicar una imagen de origen limpia, bien iluminada, bien alineada y con texto impreso. Las puntuaciones más bajas tienden a aparecer con fotos borrosas, poco contraste entre el texto y el fondo, páginas torcidas o giradas, fuentes poco habituales o texto manuscrito, para el cual Tesseract no está especializado —está construido y entrenado principalmente para texto impreso y escrito a máquina—.
Cómo obtener mejores resultados
Unos pocos hábitos mejoran notablemente la precisión: fotografiar o escanear el original lo más recto posible en lugar de en ángulo, usar una iluminación uniforme y buena, sin sombras marcadas ni reflejos, y acercarte al texto tanto como el enfoque de tu cámara lo permita, para que los caracteres no queden reducidos a un puñado de píxeles borrosos. Recortar antes de subir la imagen las zonas de fondo irrelevantes también ayuda, ya que el motor dedica menos esfuerzo a distinguir el texto del ruido visual. Si una foto arroja poca confianza, suele ser más eficaz volver a tomarla con mejor luz o con el pulso más firme que reprocesar la misma imagen de origen deficiente.
Por qué se ejecuta enteramente en tu navegador
Las herramientas de OCR tradicionales suben tu imagen a un servidor para procesarla, lo que significa que un documento con texto privado, sensible o confidencial —un contrato, un formulario médico, un documento de identidad— pasa por una infraestructura que no controlas. Ejecutar Tesseract compilado a WebAssembly evita esto por completo: el reconocimiento ocurre en tu propio dispositivo, usando tu propia CPU, así que nada del contenido de la imagen se transmite, se registra ni se almacena en ningún lugar fuera de la pestaña de tu navegador.