Kostenloses Sprache-zu-Text Online
Wandle gesprochene Wörter mit Spracherkennung in Text um. Über 20 Sprachen. Kostenlos, schnell und komplett im Browser, ohne Anmeldung.
Aktualisiert am
Speech to Text
Convert spoken words to text using your browser's speech recognition. Support for multiple languages, continuous transcription, confidence scoring, and export options.
Voice Recognition Controls
Continuous mode keeps listening after pauses. Say "period", "comma", etc. for punctuation.
Transcript
0 words, 0 characters
Words
0
Characters
0
Duration
00:00
Language
English
Transcription History
Tips for Better Recognition
- Speak clearly and at a moderate pace
- Use a good quality microphone if possible
- Minimize background noise
- Position the microphone at an appropriate distance
- Select the correct language for best results
- Enable continuous mode for longer dictation sessions
- You can edit the transcript text directly while still recording
Voice Punctuation Commands
About Speech to Text
This tool uses the Web Speech API built into modern browsers to convert your spoken words into text. It supports continuous transcription and multiple languages.
Features:
- Real-time speech recognition with interim results
- Support for 45+ languages and dialects
- Continuous and single-result listening modes
- Confidence scoring for each recognized segment
- Voice commands for punctuation and formatting
- Auto-capitalization after sentences and line breaks
- Edit transcript while still recording
- Recording timer and word count stats
- Export as .txt or .srt subtitle format
- Save and load transcription history (stored locally)
Browser Support:
- Chrome (desktop and Android) - Full support
- Edge - Full support
- Safari - Partial support
- Firefox - Not supported
Privacy Note: Speech recognition uses your browser's built-in speech API. Audio may be processed by your browser's cloud services (like Google for Chrome) for transcription. Your transcript is not stored or sent to our servers. History is saved only in your browser's local storage.
Related Tools
Häufig gestellte Fragen
Was ist Sprache-zu-Text?
Sprache-zu-Text ist ein kostenloses Online-Tool, das gesprochene Worte mithilfe von Spracherkennung in Text umwandelt – mit über 20 Sprachen. Es läuft vollständig in deinem Browser, ohne Installation oder Anmeldung.
Welche Sprachen unterstützt Sprache-zu-Text?
Sprache-zu-Text unterstützt über 20 Sprachen, darunter Englisch, Spanisch, Französisch, Deutsch, Chinesisch, Japanisch und viele weitere.
Ist Sprache-zu-Text kostenlos nutzbar?
Ja, Sprache-zu-Text ist zu 100 % kostenlos, ohne Registrierung, ohne versteckte Gebühren und ohne Nutzungslimits. Die gesamte Verarbeitung erfolgt lokal in deinem Browser und gewährleistet vollständige Privatsphäre.
Sind meine Daten mit diesem Tool sicher?
Absolut. Sprache-zu-Text verarbeitet alles clientseitig in deinem Browser. Es werden keine Daten auf einen Server hochgeladen oder dort gespeichert. Deine Inhalte bleiben jederzeit privat auf deinem Gerät.
Funktioniert Sprache-zu-Text auf Mobilgeräten?
Ja, Sprache-zu-Text ist vollständig responsiv und funktioniert auf Smartphones und Tablets. Du kannst es auf jedem Gerät mit einem modernen Webbrowser nutzen – ohne App-Download.
Muss ich ein Konto erstellen, um dieses Tool zu nutzen?
Es ist kein Konto und keine Registrierung erforderlich. Öffne einfach Sprache-zu-Text in deinem Browser und beginne sofort mit der Nutzung. Es gibt keine Anmeldebarrieren und keine Nutzungsbeschränkungen.
Kann ich große Textmengen verarbeiten?
Ja, Sprache-zu-Text verarbeitet Texte beliebiger Länge schnell und in Echtzeit. Da alles in deinem Browser läuft, hängt die Leistung von deinem Gerät ab, funktioniert aber in den meisten Fällen einwandfrei.
Wie verwende ich Sprache-zu-Text?
Gib einfach deinen Text in das vorgesehene Feld ein, passe die Einstellungen nach Wunsch an, und das Tool verarbeitet ihn sofort. Anschließend kannst du das Ergebnis in die Zwischenablage kopieren oder herunterladen.
Welche Browser werden unterstützt?
Sprache-zu-Text funktioniert in allen modernen Browsern, darunter Chrome, Firefox, Safari, Edge und Opera. Für das beste Erlebnis verwende die neueste Version deines bevorzugten Browsers.
Wie füge ich beim Diktieren mit Speech to Text Satzzeichen ein?
Du sprichst die Satzzeichen einfach laut mit. Sind die Sprachbefehle für Interpunktion aktiviert, sagst du beim Sprechen nur den Namen des Zeichens, und es wird automatisch eingefügt: „Punkt", „Komma", „Fragezeichen", „Ausrufezeichen", „Doppelpunkt", „Semikolon" und „Bindestrich". Für die Gliederung sagst du „neue Zeile" oder „neuer Absatz", um den Text umzubrechen. Der erste Buchstabe nach einem satzschließenden Zeichen sowie der Anfang jeder neuen Zeile werden automatisch großgeschrieben, sodass sich das Transkript wie geschriebener Fließtext liest und nicht wie ein endloser Wortstrom. Du musst dafür an keiner Stelle eine Sprechpause einlegen. Falls du einen Befehl vergisst, öffne das Panel mit den Sprachbefehlen für Interpunktion für die vollständige Liste. Diktiere probeweise einen Satz und beende ihn mit dem Wort „Punkt", um zu sehen, wie er korrekt mit Satzzeichen versehen erscheint.
Wie genau ist die Spracherkennung im Browser, und was bedeuten die Konfidenzwerte?
Die Genauigkeit hängt von deinem Mikrofon, Hintergrundgeräuschen, deinem Akzent und davon ab, wie gut die gewählte Sprache zu dem passt, was du sagst. Um dir eine Einschätzung zu erleichtern, aktiviere „Konfidenzwerte anzeigen" — das Tool markiert dann jedes finalisierte Segment mit dem Wert, den die Erkennungs-Engine liefert: Hoch bedeutet 90 % oder mehr und ist in der Regel korrekt, Mittel deckt 70 % bis 89 % ab und lohnt ein kurzes Korrekturlesen, und Niedrig liegt unter 70 % und enthält wahrscheinlich einen Fehler. Zusätzlich erscheint über dem Transkript ein durchschnittlicher Konfidenzwert. Niedrige Werte deuten häufig auf Geräusche, ein zu weit entferntes Mikrofon oder den falsch gewählten Dialekt hin und zeigen dir damit genau, wo eine erneute Aufnahme oder Korrektur sinnvoll ist. Weil das Transkript auch während der Aufnahme bearbeitbar bleibt, kannst du jedes Wort von Hand korrigieren. Aktiviere die Konfidenzwerte, um zu sehen, wie die Engine dein Diktat bewertet.
Kann ich ein Speech-to-Text-Transkript als Untertitel für ein Video exportieren?
Ja. Neben dem Kopieren in die Zwischenablage und dem Herunterladen als reine .txt-Datei exportiert dieses Tool dein Transkript auch als .srt-Untertiteldatei. Jedes gesprochene Segment erhält Zeitstempel, die sich danach richten, wann es während der Sitzung tatsächlich erkannt wurde, sodass die Untertitel ungefähr zu dem Moment passen, in dem du die jeweilige Phrase gesagt hast. Das macht es zu einer schnellen Möglichkeit, Untertitel für eine Bildschirmaufnahme, ein Voiceover oder ein Video mit Sprecher grob zu erstellen, die du anschließend in deinem Videoschnittprogramm verfeinerst. Beachte, dass der .srt-Export erst funktioniert, sobald mindestens ein Segment finalisiert wurde, da die Zeitangaben aus echten Erkennungsereignissen stammen und nicht geschätzt werden. Für die saubersten Untertitel diktiere in gleichmäßigem Tempo und bearbeite Segmente mit niedriger Konfidenz vor dem Export. Nimm deine Erzählung auf und klicke anschließend auf die .srt-Schaltfläche, um fertige Untertitel herunterzuladen.
Warum funktioniert Speech to Text in Firefox nicht und in Safari nur eingeschränkt?
Dieses Tool basiert auf der Web Speech API, der Spracherkennungsfunktion, die direkt in den Browser eingebaut ist, und nicht jeder Browser stellt sie zur Verfügung. Die Erkennung ist in Chrome auf Desktop und Android sowie in Edge vollständig verfügbar, weshalb diese empfohlen werden. Safari bietet nur teilweise Unterstützung, weshalb die Ergebnisse dort weniger zuverlässig ausfallen können, und Firefox stellt die Spracherkennungs-API derzeit überhaupt nicht bereit, sodass das Tool dort schlicht nicht laufen kann. Fehlt die Unterstützung in deinem Browser, erkennt die Seite das und zeigt eine klare Meldung an, statt stillschweigend zu versagen. Die Lösung besteht darin, das Tool in Chrome oder Edge zu öffnen, wo Diktat, Dauermodus und Konfidenzwerte vollständig funktionieren. Startet die Erkennung nicht, wechsle zu einem unterstützten Browser und erlaube den Mikrofonzugriff, wenn du dazu aufgefordert wirst.
Verbessert die Wahl der richtigen Sprache oder des richtigen Dialekts die Spracherkennung?
Ja, und zwar deutlich mehr, als man erwarten würde. Das Tool bietet mehr als 45 Sprachen und regionale Dialekte, darunter mehrere Varianten von Englisch, Spanisch, Französisch, Portugiesisch, Chinesisch und Arabisch sowie Hindi, Bengali, Tamil, Japanisch, Koreanisch, Deutsch und viele weitere. Die Erkennungs-Engine stellt sich auf den Akzent und den Wortschatz des gewählten Dialekts ein, sodass die Wahl von Englisch (Indien) statt Englisch (USA) oder Spanisch (Mexiko) statt Spanisch (Spanien) die Fehlerquote spürbar senken kann, wenn das zu deiner Sprechweise passt. Ein nicht passender Dialekt ist eine häufige Ursache für niedrige Konfidenzwerte und merkwürdige Wortwahl. Stelle die Sprache ein, bevor du mit der Aufnahme beginnst, denn sie lässt sich während einer laufenden Sitzung nicht mehr ändern. Wähle den Dialekt, der deinem eigenen Akzent am nächsten kommt, halte Hintergrundgeräusche gering und sprich in moderatem Tempo für das sauberste Transkript.
Embed This Tool
Add a free, live version of this widget to your own website or blog post — it runs entirely in your visitors' browsers, with a credit link back to The Toolbox.
<iframe src="https://getthetoolbox.com/embed/speech-to-text" title="Free Speech to Text Online — The Toolbox" width="100%" height="280" style="max-width:480px;border:1px solid #e2e8f0;border-radius:12px" loading="lazy"></iframe>
<p style="font-size:12px;margin:4px 0 0"><a href="https://getthetoolbox.com/text-tools/speech-to-text?utm_source=embed&utm_medium=widget" target="_blank" rel="noopener">Free Speech to Text Online</a> by The Toolbox</p>Verwandte Tools
Kostenloses Text-zu-Sprache Online
Wandle Text mit der Browser-Synthese in Sprache um. Mehrere Stimmen verfügbar. Kostenlos, schnell und komplett im Browser, ohne Anmeldung.
Kostenloser Wortzähler Online
Zählen Sie sofort Wörter, Zeichen, Sätze, Absätze und die Lesezeit. Kostenloser Online-Wortzähler. Läuft vollständig in Ihrem Browser, ganz ohne Anmeldung.
Kostenloser Groß-/Kleinschreibung-Konverter Online
Wandeln Sie Text in Groß-, Kleinschreibung, Titel- oder Satzschreibung um. Kostenloser Online-Konverter für Groß- und Kleinschreibung. Läuft vollständig in Ihrem Browser, ganz ohne Anmeldung.
Kostenloser Lorem-Ipsum-Generator
Erzeugen Sie Lorem-Ipsum-Platzhaltertext für Design- und Entwicklungsprojekte. Kostenlos, schnell und vollständig in Ihrem Browser, ganz ohne Anmeldung.
Über das kostenlose Speech-to-Text-Tool
Speech to Text verwandelt deine gesprochenen Worte in Echtzeit in geschriebenen Text. Klicke auf „Aufnahme starten", erlaube den Mikrofonzugriff, und während du sprichst, erscheint das Gesagte in einem editierbaren Transkript-Feld — inklusive einer live mitlaufenden „Hearing"-Vorschau der Wörter, die noch verarbeitet werden, bevor sie endgültig übernommen werden. Entwickelt für alle, die schneller denken, als sie tippen können: Autor:innen, die per Diktat schreiben, Studierende, die Vorlesungsnotizen festhalten, Berufstätige, die E-Mails diktieren, und Menschen, denen eine Tastatur zu mühsam oder nicht zugänglich ist.
Das Tool läuft über die Web Speech API, die fest in moderne Browser eingebaut ist — es gibt nichts zu installieren und kein Konto anzulegen. Am besten funktioniert die Erkennung in Chrome (Desktop und Android) und Edge, wo die Unterstützung vollständig ist. Safari bietet nur teilweise Unterstützung, und Firefox stellt die Spracherkennungs-API derzeit gar nicht zur Verfügung — in diesem Fall weist dich das Tool direkt darauf hin, dass dein Browser es nicht ausführen kann.
So funktionieren Diktat und Interpunktion
Du musst zum Setzen von Satzzeichen nicht innehalten. Sind die Sprachbefehle für Interpunktion aktiviert, genügt es, den Namen des Zeichens zu sagen, und es wird automatisch eingefügt — „Punkt", „Komma", „Fragezeichen", „Ausrufezeichen", „Doppelpunkt", „Semikolon", „Bindestrich", „Anführungszeichen auf" und „Anführungszeichen zu", dazu „neue Zeile" und „neuer Absatz" für den Zeilenumbruch. Der erste Buchstabe nach einem satzschließenden Zeichen wird automatisch großgeschrieben, ebenso der Anfang jeder neuen Zeile — das Ergebnis liest sich wie geschriebener Fließtext und nicht wie ein roher Wortstrom.
Zwei Aufnahmemodi prägen längere Sitzungen. Der Dauermodus hält das Mikrofon über natürliche Sprechpausen hinweg aktiv und startet die Erkennung im Hintergrund neu, damit ein langes Diktat nicht abbricht, sobald du Luft holst. Der Einzelergebnis-Modus stoppt nach einer Phrase, praktisch für kurze Schnipsel wie eine Suchanfrage oder einen einzelnen Satz. Ein Aufnahme-Timer sowie eine laufende Wort- und Zeichenzählung sind währenddessen ständig aktiv.
Die Konfidenzwerte richtig lesen
Die Spracherkennung des Browsers liefert für jedes finalisierte Segment einen Konfidenzwert — eine Einschätzung, wie sicher sich die Engine ist, dich richtig verstanden zu haben. Aktiviere „Konfidenzwerte anzeigen", und jedes Segment wird entsprechend markiert:
- Hoch — 90 % Konfidenz oder mehr, in der Regel korrekt.
- Mittel — 70 % bis 89 %, ein kurzes Korrekturlesen lohnt sich.
- Niedrig — unter 70 %, wahrscheinlich fehlerhaft.
Zusätzlich erscheint über dem Transkript ein durchschnittlicher Konfidenzwert. Niedrige Werte deuten häufig auf Hintergrundgeräusche, ein zu weit entferntes Mikrofon oder die falsch gewählte Sprache hin und zeigen dir damit, wo sich eine erneute Aufnahme oder eine Korrektur lohnt. Das Transkript bleibt jederzeit vollständig bearbeitbar — du kannst ein Wort von Hand korrigieren, selbst während die Aufnahme weiterläuft.
Exportieren, Verlauf und Datenschutz
Fertige Transkripte lassen sich in die Zwischenablage kopieren, als reine .txt-Datei herunterladen oder als .srt-Untertiteldatei exportieren, deren Zeitstempel sich danach richten, wann jedes Segment gesprochen wurde — praktisch, um ein Video zu untertiteln. Über die Schaltfläche „Speichern" wird eine Transkription zusammen mit Sprache, Dauer und Wortzahl im lokalen Speicher deines Browsers abgelegt; frühere Einträge kannst du im Verlaufsbereich erneut laden oder löschen, der die zuletzt erstellten Transkriptionen auf diesem Gerät vorhält.
Ein Hinweis zum Datenschutz, den man kennen sollte: Weil dieses Tool auf die eingebaute Spracherkennungs-Engine des Browsers zurückgreift, kann das Audiosignal zur Transkription an den Cloud-Dienst des jeweiligen Browser-Anbieters gesendet werden — Chrome etwa leitet das Audio über den Erkennungsdienst von Google. Diese Verarbeitung übernimmt dein Browser, nicht diese Website. Der Text deines Transkripts wird niemals auf unsere Server hochgeladen oder dort gespeichert, und dein gespeicherter Verlauf existiert ausschließlich im lokalen Speicher deines Browsers.
Das Speech-to-Text-Tool deckt mehr als 45 Sprachen und regionale Dialekte ab, darunter mehrere Varianten von Englisch, Spanisch, Französisch, Portugiesisch, Chinesisch und Arabisch sowie Hindi, Japanisch, Koreanisch, Deutsch und viele weitere. Wählst du den Dialekt, der deinem Akzent am nächsten kommt — etwa Englisch (Indien) statt Englisch (USA) —, verbessert das die Genauigkeit spürbar. Für die saubersten Ergebnisse sprich in moderatem Tempo, halte Hintergrundgeräusche gering und positioniere dein Mikrofon in gleichbleibendem Abstand.