Voz a Texto Online Gratis

Convierte palabras habladas en texto con reconocimiento de voz. Más de 20 idiomas. Gratis, rápido y funciona totalmente en tu navegador, sin registro.

Actualizado

Share:
Home/Text Tools/Speech to Text

Speech to Text

Convert spoken words to text using your browser's speech recognition. Support for multiple languages, continuous transcription, confidence scoring, and export options.

Voice Recognition Controls

Continuous mode keeps listening after pauses. Say "period", "comma", etc. for punctuation.

Transcript

0 words, 0 characters

Words

0

Characters

0

Duration

00:00

Language

English

Transcription History

Tips for Better Recognition

  • Speak clearly and at a moderate pace
  • Use a good quality microphone if possible
  • Minimize background noise
  • Position the microphone at an appropriate distance
  • Select the correct language for best results
  • Enable continuous mode for longer dictation sessions
  • You can edit the transcript text directly while still recording

Voice Punctuation Commands

About Speech to Text

This tool uses the Web Speech API built into modern browsers to convert your spoken words into text. It supports continuous transcription and multiple languages.

Features:

  • Real-time speech recognition with interim results
  • Support for 45+ languages and dialects
  • Continuous and single-result listening modes
  • Confidence scoring for each recognized segment
  • Voice commands for punctuation and formatting
  • Auto-capitalization after sentences and line breaks
  • Edit transcript while still recording
  • Recording timer and word count stats
  • Export as .txt or .srt subtitle format
  • Save and load transcription history (stored locally)

Browser Support:

  • Chrome (desktop and Android) - Full support
  • Edge - Full support
  • Safari - Partial support
  • Firefox - Not supported

Privacy Note: Speech recognition uses your browser's built-in speech API. Audio may be processed by your browser's cloud services (like Google for Chrome) for transcription. Your transcript is not stored or sent to our servers. History is saved only in your browser's local storage.

Preguntas Frecuentes

¿Qué es Voz a Texto?

Voz a Texto es una herramienta online gratuita que convierte las palabras habladas en texto mediante el reconocimiento de voz, con más de 20 idiomas. Funciona íntegramente en tu navegador, sin necesidad de instalación ni registro.

¿Qué idiomas admite Voz a Texto?

Voz a Texto admite más de 20 idiomas, incluidos inglés, español, francés, alemán, chino, japonés y muchos más.

¿Es gratis usar Voz a Texto?

Sí, Voz a Texto es 100 % gratis, sin registro, sin tarifas ocultas y sin límites de uso. Todo el procesamiento se realiza localmente en tu navegador, garantizando una privacidad total.

¿Están seguros mis datos con esta herramienta?

Por supuesto. Voz a Texto procesa todo del lado del cliente, en tu navegador. No se sube ni se almacena ningún dato en ningún servidor. Tu contenido permanece siempre privado en tu dispositivo.

¿Funciona Voz a Texto en dispositivos móviles?

Sí, Voz a Texto es totalmente adaptable y funciona en smartphones y tablets. Puedes usarlo en cualquier dispositivo con un navegador web moderno, sin necesidad de descargar ninguna app.

¿Necesito crear una cuenta para usar esta herramienta?

No se necesita cuenta ni registro. Simplemente abre Voz a Texto en tu navegador y empieza a usarlo de inmediato. No hay muros de registro ni restricciones de uso.

¿Puedo procesar grandes cantidades de texto?

Sí, Voz a Texto gestiona texto de cualquier longitud con un procesamiento rápido y en tiempo real. Como todo se ejecuta en tu navegador, el rendimiento depende de tu dispositivo, pero funciona bien en la mayoría de los casos.

¿Cómo uso Voz a Texto?

Simplemente introduce tu texto en el campo proporcionado, ajusta los parámetros a tu gusto y la herramienta lo procesará al instante. Después podrás copiar el resultado al portapapeles o descargarlo.

¿Qué navegadores son compatibles?

Voz a Texto funciona en todos los navegadores modernos, incluidos Chrome, Firefox, Safari, Edge y Opera. Para una mejor experiencia, usa la última versión de tu navegador preferido.

¿Cómo añado la puntuación al dictar con voz a texto?

Dices el signo de puntuación en voz alta. Con los comandos de puntuación por voz activados, basta con decir el nombre del signo mientras hablas para que se inserte automáticamente: "punto", "coma", "signo de interrogación", "signo de exclamación", "dos puntos", "punto y coma" y "guion". Para el formato, di "nueva línea" o "nuevo párrafo" para separar el texto. La primera letra después de un signo que termina una frase y el inicio de cada línea nueva se ponen en mayúscula automáticamente, de modo que la transcripción se lee como prosa escrita y no como un flujo continuo de palabras. No es necesario pausar el habla para insertar nada. Si olvidas un comando, abre el panel de Comandos de Puntuación por Voz para ver la lista completa. Prueba a dictar una frase y terminarla con la palabra "punto" para verla aparecer correctamente puntuada.

¿Qué tan precisa es la conversión de voz a texto del navegador y qué significan las puntuaciones de confianza?

La precisión depende de tu micrófono, el ruido de fondo, tu acento y de qué tan bien coincide el idioma seleccionado con lo que estás diciendo. Para ayudarte a evaluarla, activa Mostrar puntuaciones de confianza y la herramienta etiqueta cada segmento finalizado según el valor que devuelve el motor de reconocimiento: Alta significa 90% o más y suele ser correcta, Media cubre entre 70% y 89% y conviene revisarla rápidamente, y Baja está por debajo del 70% y es probable que contenga un error. Encima de la transcripción también aparece una cifra de confianza promedio. Las puntuaciones bajas suelen indicar ruido, un micrófono alejado o el dialecto equivocado seleccionado, así que te indican exactamente dónde volver a grabar o corregir el texto. Como la transcripción se puede editar incluso mientras grabas, puedes corregir cualquier palabra a mano. Activa las puntuaciones de confianza para ver cómo el motor evalúa tu dictado.

¿Puedo exportar una transcripción de voz a texto como subtítulos para un vídeo?

Sí. Además de copiarla al portapapeles y descargarla como archivo .txt de texto plano, esta herramienta exporta tu transcripción como archivo de subtítulos .srt. Cada segmento hablado recibe marcas de tiempo derivadas del momento en que realmente fue reconocido durante la sesión, de modo que los subtítulos coinciden aproximadamente con el momento en que dijiste cada frase. Eso la convierte en una forma rápida de esbozar subtítulos para una grabación de pantalla, una locución o un vídeo en el que hablas a cámara, que luego puedes perfeccionar en tu editor de vídeo. Ten en cuenta que la exportación a .srt solo funciona una vez que tienes al menos un segmento finalizado, ya que los tiempos provienen de eventos de reconocimiento reales y no de estimaciones. Para lograr los subtítulos más prolijos, dicta a un ritmo constante y edita los segmentos de baja confianza antes de exportar. Graba tu narración y luego haz clic en el botón .srt para descargar subtítulos listos para usar.

¿Por qué la conversión de voz a texto no funciona en Firefox o no funciona del todo en Safari?

Esta herramienta depende de la Web Speech API, la función de reconocimiento de voz integrada directamente en el navegador, y no todos los navegadores la exponen. El reconocimiento es completo en Chrome de escritorio y Android y en Edge, por lo que se recomiendan esos navegadores. Safari solo ofrece soporte parcial, por lo que los resultados pueden ser menos fiables ahí, y Firefox actualmente no expone en absoluto la API de reconocimiento de voz, así que la herramienta simplemente no puede ejecutarse en él. Cuando tu navegador carece de soporte, la página lo detecta y muestra un mensaje claro en lugar de fallar en silencio. La solución es abrir la herramienta en Chrome o Edge, donde el dictado, el modo continuo y la puntuación de confianza funcionan correctamente. Si el reconocimiento no se inicia, cambia a un navegador compatible y concede acceso al micrófono cuando se te solicite.

¿Elegir el idioma o dialecto correcto mejora el reconocimiento de voz?

Sí, y esto importa más de lo que la gente espera. La herramienta ofrece más de 45 idiomas y dialectos regionales, incluidas varias variantes de inglés, español, francés, portugués, chino y árabe, además de hindi, bengalí, tamil, japonés, coreano, alemán y muchos más. El motor de reconocimiento se ajusta al acento y al vocabulario del dialecto que elijas, de modo que seleccionar inglés (India) en lugar de inglés (EE. UU.), o español (México) en lugar de español (España), puede reducir notablemente los errores cuando coincide con tu forma de hablar. Un dialecto mal elegido es una causa común de puntuaciones de confianza bajas y de elecciones de palabras extrañas. Configura el idioma antes de empezar a grabar, ya que no se puede cambiar a mitad de sesión. Elige el dialecto más cercano a tu propio acento, reduce el ruido de fondo y habla a un ritmo moderado para obtener la transcripción más limpia.

Embed This Tool

Add a free, live version of this widget to your own website or blog post — it runs entirely in your visitors' browsers, with a credit link back to The Toolbox.

Copy & paste this HTML
<iframe src="https://getthetoolbox.com/embed/speech-to-text" title="Free Speech to Text Online — The Toolbox" width="100%" height="280" style="max-width:480px;border:1px solid #e2e8f0;border-radius:12px" loading="lazy"></iframe>
<p style="font-size:12px;margin:4px 0 0"><a href="https://getthetoolbox.com/text-tools/speech-to-text?utm_source=embed&utm_medium=widget" target="_blank" rel="noopener">Free Speech to Text Online</a> by The Toolbox</p>

Acerca de Voz a Texto Online Gratis

Voz a Texto convierte tu voz en texto escrito en tiempo real. Haz clic en Iniciar grabación, concede acceso al micrófono y tus palabras irán apareciendo en un cuadro de transcripción editable mientras hablas, con una vista previa en vivo de "Escuchando" que muestra las palabras aún en proceso. Está pensada para cualquiera que piense más rápido de lo que escribe: escritores que redactan por voz, estudiantes que toman apuntes de clase, profesionales que dictan correos electrónicos y personas para quienes el teclado resulta cansado o poco accesible.

La herramienta funciona sobre la Web Speech API integrada en los navegadores modernos, así que no hay nada que instalar ni cuenta que crear. El reconocimiento funciona mejor en Chrome (escritorio y Android) y Edge, donde el soporte es completo. Safari ofrece soporte parcial, y Firefox actualmente no expone la API de reconocimiento de voz, por lo que la herramienta te avisará si tu navegador no puede ejecutarla.

Cómo funcionan el dictado y la puntuación

No hace falta dejar de hablar para añadir signos de puntuación. Con los comandos de puntuación por voz activados, basta con decir el nombre del signo para que se inserte automáticamente: "punto", "coma", "signo de interrogación", "signo de exclamación", "dos puntos", "punto y coma", "guion", "comillas de apertura" y "comillas de cierre", además de "nueva línea" y "nuevo párrafo" para el espaciado. La primera letra después de un signo que termina una frase se pone en mayúscula automáticamente, igual que el inicio de cada línea nueva, de modo que el resultado se lee como prosa y no como palabras sueltas.

Dos modos de escucha determinan cómo se comportan las sesiones más largas. El modo continuo mantiene el micrófono activo durante las pausas naturales, reiniciando el reconocimiento en segundo plano para que un dictado largo no se corte cuando respiras. El modo de resultado único se detiene tras una sola frase, algo útil para fragmentos cortos como una consulta de búsqueda o una sola oración. Un temporizador de grabación y contadores de palabras y caracteres en vivo funcionan durante toda la sesión.

Cómo interpretar las puntuaciones de confianza

El reconocimiento de voz del navegador devuelve un valor de confianza para cada segmento finalizado: una estimación de cuán seguro está el motor de haberte entendido correctamente. Activa Mostrar puntuaciones de confianza y cada segmento queda etiquetado:

  • Alta — 90% de confianza o más, normalmente precisa.
  • Media — entre 70% y 89%, conviene revisarla rápidamente.
  • Baja — por debajo del 70%, es probable que contenga un error.

Encima de la transcripción también aparece una cifra de confianza promedio. Las puntuaciones bajas suelen indicar ruido de fondo, un micrófono alejado o un idioma mal seleccionado, una señal útil sobre dónde volver a grabar o editar. La transcripción se puede editar en todo momento: puedes corregir una palabra a mano incluso mientras la grabación continúa.

Exportación, historial y privacidad

Las transcripciones terminadas se pueden copiar al portapapeles, descargar como archivo de texto plano .txt o exportar como archivo de subtítulos .srt con marcas de tiempo derivadas del momento en que se pronunció cada segmento, útil para subtitular un vídeo. El botón Guardar almacena una transcripción, junto con su idioma, duración y número de palabras, en el almacenamiento local de tu navegador; puedes recargar o eliminar entradas anteriores desde el panel Historial, que conserva tus transcripciones más recientes en ese dispositivo.

Una nota de privacidad importante: como esta herramienta depende del motor de voz integrado del navegador, el audio puede enviarse al servicio en la nube del fabricante del navegador para su transcripción; por ejemplo, Chrome envía el audio a través del servicio de reconocimiento de Google. Ese procesamiento lo gestiona tu navegador, no este sitio. El texto de tu transcripción nunca se sube ni se almacena en nuestros servidores, y tu historial guardado vive únicamente en el almacenamiento local de tu navegador.

La herramienta Voz a Texto cubre más de 45 idiomas y dialectos regionales, incluidas varias variantes de inglés, español, francés, portugués, chino y árabe, junto con hindi, japonés, coreano, alemán y muchos más. Elegir el dialecto más cercano a tu acento —por ejemplo, inglés (India) en lugar de inglés (EE. UU.)— mejora notablemente la precisión. Para obtener los mejores resultados, habla a un ritmo moderado, reduce el ruido de fondo y mantén el micrófono a una distancia constante.