N-Gramm-Extraktor
Extrahieren und analysieren Sie Wort- und Zeichen-N-Gramme (Unigramme, Bigramme, Trigramme, 4-Gramme, 5-Gramme) mit Häufigkeitszählungen, Prozentsätzen und Diversitätsmetriken.
Aktualisiert am
Input Text
Options
Total N-grams
0
Unique N-grams
0
Diversity Ratio
0.0%
N-gram Tableword-2gram
Enter text above to extract n-grams.
Häufig gestellte Fragen
Was ist ein N-Gramm?
Eine zusammenhängende Folge von n Elementen (Wörter oder Zeichen). Unigramme = einzelne Wörter, Bigramme = Paare, Trigramme = Dreiergruppen. N-Gramme sind grundlegend für NLP und Sprachmodellierung.
Wort- oder Zeichen-N-Gramme?
Wort-N-Gramme sind Folgen von Wörtern ("machine learning" ist ein Wort-Bigramm). Zeichen-N-Gramme sind Zeichenfolgen, besonders nützlich für Spracherkennung und unscharfen Abgleich.
Was ist das Diversitätsverhältnis?
Das Type-Token-Verhältnis: der Prozentsatz eindeutiger N-Gramme im Verhältnis zur Gesamtzahl. Höher = mehr lexikalische Vielfalt; niedriger = Wiederholung. Ein klassisches Maß in der Korpuslinguistik.
Ist der N-Gramm-Extraktor kostenlos?
Ja, der N-Gramm-Extraktor ist zu 100% kostenlos, ohne Registrierung, ohne versteckte Gebühren und ohne Nutzungslimits. Die gesamte Verarbeitung erfolgt lokal in deinem Browser und gewährleistet vollständige Privatsphäre.
Sind meine Daten mit diesem Tool sicher?
Absolut. Der N-Gramm-Extraktor verarbeitet alles clientseitig in deinem Browser. Es werden keine Daten auf einen Server hochgeladen oder dort gespeichert. Deine Inhalte bleiben jederzeit privat auf deinem Gerät.
Funktioniert der N-Gramm-Extraktor auf Mobilgeräten?
Ja, der N-Gramm-Extraktor ist vollständig responsiv und funktioniert auf Smartphones und Tablets. Du kannst ihn auf jedem Gerät mit einem modernen Webbrowser nutzen, ohne App-Download.
Muss ich ein Konto erstellen, um dieses Tool zu nutzen?
Es ist kein Konto und keine Registrierung erforderlich. Öffne einfach den N-Gramm-Extraktor in deinem Browser und beginne sofort mit der Nutzung. Es gibt keine Anmeldeschranken oder Nutzungsbeschränkungen.
Kann ich große Textmengen verarbeiten?
Ja, der N-Gramm-Extraktor verarbeitet Texte beliebiger Länge schnell und in Echtzeit. Da alles in deinem Browser läuft, hängt die Leistung von deinem Gerät ab, funktioniert aber für die meisten Anwendungsfälle gut.
Wie verwende ich den N-Gramm-Extraktor?
Gib einfach deinen Text in das vorgesehene Feld ein, passe die Einstellungen nach Wunsch an, und das Tool verarbeitet ihn sofort. Anschließend kannst du das Ergebnis in die Zwischenablage kopieren oder herunterladen.
Welche Browser werden unterstützt?
Der N-Gramm-Extraktor funktioniert in allen modernen Browsern, darunter Chrome, Firefox, Safari, Edge und Opera. Für die beste Erfahrung verwende die neueste Version deines bevorzugten Browsers.
Warum sollte ich vor der N-Gramm-Extraktion Stoppwörter entfernen?
Stoppwörter sind häufige Funktionswörter wie "the", "of", "and" und "to", die ständig vorkommen, aber kaum Bedeutung tragen. Lässt man sie im Text, füllen sich die Top-Bigramme und -Trigramme mit Kombinationen wie "of the" und "in the", die die Phrasen überdecken, auf die es eigentlich ankommt. Aktiviert man die Option zum Entfernen von Stoppwörtern, werden diese Tokens vor der Zählung herausgefiltert, sodass bedeutungsvolle Sequenzen wie "natural language processing" ganz oben im Ranking erscheinen. Das ist besonders nützlich für die SEO-Keyword-Analyse und die Themenerkennung, wo es auf die inhaltlich relevanten Phrasen ankommt und nicht auf das grammatikalische Bindegewebe. Für rein linguistische oder stilometrische Arbeiten möchten Sie Stoppwörter womöglich beibehalten, da schon ihre Häufigkeit ein eigenes Signal ist. Schalten Sie die Option in diesem Tool um und beobachten Sie, wie sich das Ranking sofort aktualisiert, um beide Ansichten zu vergleichen.
Was ist der Unterschied zwischen Unigrammen, Bigrammen und Trigrammen in der Praxis?
Alle drei sind Wort-N-Gramme; die Zahl bestimmt lediglich die Länge der Sequenz. Unigramme sind einzelne Wörter, ihre Häufigkeitstabelle ist im Grunde eine Wortzählung, die zeigt, welche Begriffe einen Text dominieren. Bigramme sind Zweiwort-Paare wie "machine learning" und offenbaren erstmals Phrasen und Wortkombinationen statt isolierter Wörter. Trigramme sind Dreiwort-Folgen wie "natural language processing" und erfassen noch spezifischere, wiederkehrende Ausdrücke, auch wenn die Häufigkeiten mit zunehmender Länge sinken, weil längere exakte Übereinstimmungen seltener sind. Kurz gesagt: kleinere N-Gramme zeigen den Wortschatz, größere die Formulierung. Dieses Tool unterstützt zusätzlich Quadrigramme und 5-Gramme, um wiederholte lange Phrasen oder Textbausteine aufzuspüren. Wechseln Sie zwischen den Größen eins bis fünf über die Tabs und vergleichen Sie, wie sich die Rankings verschieben, um die für Ihre Analyse passende Ebene zu finden.
Warum verändern sich meine N-Gramm-Zählungen, wenn ich N-Gramme über Satzgrenzen hinweg aktiviere?
Standardmäßig lässt dieses Tool kein N-Gramm über eine Satzgrenze hinausreichen, sodass das letzte Wort eines Satzes niemals mit dem ersten Wort des nächsten kombiniert wird. Das verhindert, dass unzusammenhängende Wörter zu Phrasen verklebt werden, die in Wirklichkeit nie gemeinsam auftreten, und hält Bigramm- und Trigramm-Zählungen für die Phrasenanalyse präzise. Aktivieren Sie die Option "N-Gramme über Satzgrenzen hinweg zulassen", werden Sequenzen durchgehend über den gesamten Text gezählt, unabhängig von Satzzeichen, wodurch Sie mehr N-Gramme insgesamt und einige neue Paare erhalten, die Satzgrenzen überbrücken. Nutzen Sie die Standardeinstellung für saubere Phrasen- und Kollokationsanalysen, und aktivieren Sie die satzübergreifende Zählung, wenn Sie rohe Sequenzstatistiken über das gesamte Dokument benötigen, etwa für bestimmte Sprachmodellierungs-Experimente. Schalten Sie die Option hier um, und Gesamtzahlen sowie Ranking werden sofort neu berechnet, sodass Sie den Effekt direkt sehen.
Wie exportiere ich N-Gramm-Häufigkeitsdaten in eine Tabellenkalkulation oder ein Skript?
Nach der Analyse Ihres Textes nutzen Sie die Download-Buttons, um die vollständigen Ergebnisse entweder als CSV oder als JSON zu speichern. Die CSV-Datei öffnet sich direkt in Excel, Google Sheets oder Numbers mit Spalten für das N-Gramm, seine Häufigkeit und seinen prozentualen Anteil — bereit zum Sortieren, für Diagramme oder Pivot-Tabellen. Die JSON-Datei ist für den Einsatz in Code strukturiert und enthält neben den N-Grammen auch zusammenfassende Kennzahlen wie Gesamtzahl, eindeutige Anzahl und das Diversitätsverhältnis, was das Laden in Python, R oder ein Node-Skript für eine tiefergehende Analyse erleichtert. Auch wenn die Tabelle auf dem Bildschirm aus Performance-Gründen bei 500 Zeilen begrenzt ist, enthalten die exportierten Dateien immer die vollständige Liste aller gefundenen N-Gramme, sodass nichts verloren geht. Sie können die Ergebnisse außerdem für ein schnelles Einfügen in die Zwischenablage kopieren. Lassen Sie Ihren Text durch dieses Tool laufen und laden Sie das Format herunter, das zu Ihrem Workflow passt.
Wie genau ist der N-Gramm-Extraktor für die SEO-Keyword-Dichte-Analyse?
Als reiner Häufigkeitszähler ist er präzise: Er gibt exakt an, wie oft jedes Wort und jede Phrase vorkommt und welchen Anteil am Gesamtwert das jeweils ausmacht — das ist die ehrliche Grundlage der Keyword-Dichte. Die Prozentspalte zeigt Ihnen, ob eine Zielphrase oft genug vorkommt, um Relevanz zu signalisieren, oder so oft, dass es als Keyword-Stuffing wirkt. Für verlässliche SEO-Ergebnisse aktivieren Sie "Satzzeichen entfernen" und führen Sie die Groß-/Kleinschreibung zusammen, damit Varianten wie "Apple" und "apple." als ein einziges Token gezählt werden, und erwägen Sie, Stoppwörter zu entfernen, um die eigentlichen Themenphrasen sichtbar zu machen. Bedenken Sie, dass Häufigkeit allein kein Rankingfaktor ist; moderne Suchmaschinen gewichten Kontext und Suchintention, betrachten Sie diese Zählungen also als Diagnosewerkzeug, nicht als Quote. Fügen Sie Ihren Entwurf oder die Seite eines Mitbewerbers hier ein, prüfen Sie die Bigramm- und Trigramm-Tabellen und passen Sie Ihre Formulierungen mit Sicherheit an.
Verwandte Tools
Kostenloser Wortzähler Online
Zählen Sie sofort Wörter, Zeichen, Sätze, Absätze und die Lesezeit. Kostenloser Online-Wortzähler. Läuft vollständig in Ihrem Browser, ganz ohne Anmeldung.
Kostenloser Groß-/Kleinschreibung-Konverter Online
Wandeln Sie Text in Groß-, Kleinschreibung, Titel- oder Satzschreibung um. Kostenloser Online-Konverter für Groß- und Kleinschreibung. Läuft vollständig in Ihrem Browser, ganz ohne Anmeldung.
Kostenloser Lorem-Ipsum-Generator
Erzeugen Sie Lorem-Ipsum-Platzhaltertext für Design- und Entwicklungsprojekte. Kostenlos, schnell und vollständig in Ihrem Browser, ganz ohne Anmeldung.
Kostenloser Entferner für doppelte Zeilen
Entfernen Sie doppelte Zeilen aus Ihrem Text unter Beibehaltung der Reihenfolge. Kostenloses Online-Tool. Läuft vollständig in Ihrem Browser, ganz ohne Anmeldung.
Über den N-Gramm-Extraktor
Der N-Gramm-Extraktor zerlegt jeden Textblock in seine wiederkehrenden Sequenzen und zählt, wie oft jede davon vorkommt. Fügen Sie einen Artikel, ein Transkript, eine Sammlung von Produktbewertungen oder einen Export von Suchanfragen ein, und das Tool liefert sortierte Tabellen mit Wort- und Zeichen-N-Grammen samt Häufigkeiten, Prozentanteilen und einem Wert für die lexikalische Vielfalt. Es wurde für SEO-Texter entwickelt, die Phrasenwiederholungen prüfen, für Linguisten und Studierende, die Korpora untersuchen, sowie für Entwickler, die Prototypen bauen, die auf Häufigkeitsdaten basieren.
Ein N-Gramm ist eine zusammenhängende Folge von n Elementen aus einem Text. Ein Unigramm ist ein einzelnes Wort, ein Bigramm ein Paar wie „machine learning", und ein Trigramm eine Dreiergruppe wie „natural language processing". Dasselbe Prinzip gilt für Zeichen: „th", „the" und „ther" sind 2-, 3- und 4-Zeichen-N-Gramme. Diese Sequenzen sind der Rohstoff hinter Autovervollständigung, Spracherkennung, Spamfiltern und den statistischen Sprachmodellen, die den heutigen neuronalen Systemen vorausgingen.
Was Sie extrahieren und anpassen können
Das Tool arbeitet gleichzeitig auf zwei Ebenen, die auf getrennten Tabs angezeigt werden:
- Wort-N-Gramme von Größe 1 bis 5 — Unigramm, Bigramm, Trigramm, Quadrigramm und 5-Gramm.
- Zeichen-N-Gramme von 1 bis 5 Zeichen, unabhängig von Wortgrenzen und nützlich für unscharfen Abgleich (Fuzzy Matching) und Sprach-Fingerprinting.
Mehrere Optionen beeinflussen, wie der Text vor dem Zählen tokenisiert wird:
- Groß-/Kleinschreibung — „Apple" und „apple" getrennt behandeln oder zusammenführen (Standardeinstellung).
- Stoppwörter entfernen — häufige Funktionswörter wie „the", „of" und „and" streichen, damit die bedeutungstragenden Phrasen nach oben rücken.
- Satzzeichen entfernen — Symbole entfernen, sodass „word." und „word" als dasselbe Token gezählt werden.
- N-Gramme über Satzgrenzen hinweg zulassen — standardmäßig überschreiten Sequenzen keine Satzgrenze, damit nicht zusammengehörige Phrasen nicht künstlich verknüpft werden; aktivieren Sie diese Option, um über den gesamten Text hinweg zu zählen.
- Mindesthäufigkeits-Filter — Einzelvorkommen ausblenden und nur N-Gramme anzeigen, die mindestens eine festgelegte Anzahl von Malen auftreten.
Was die Ergebnisse aussagen
Jeder Tab zeigt drei zentrale Kennzahlen: die Gesamtzahl der N-Gramme (jede gefundene Sequenz), die Anzahl der eindeutigen N-Gramme (unterschiedliche Sequenzen) und das Diversitätsverhältnis. Dieses Verhältnis ist die Type-Token-Ratio — eindeutige geteilt durch gesamte Vorkommen, dargestellt als Prozentwert. Ein hoher Wert deutet auf abwechslungsreiche Formulierungen hin, ein niedriger Wert auf Wiederholungen, was entweder für einen knappen, fokussierten Text oder einen aufgeblähten, formelhaften Text sprechen kann.
Unter den Kennzahlen hebt ein Balkendiagramm die zehn häufigsten Sequenzen hervor, und eine vollständige Tabelle listet jedes N-Gramm nach Rang, Häufigkeit und Anteil am Gesamtwert auf. Die Tabelle zeigt aus Performance-Gründen auf dem Bildschirm bis zu 500 Zeilen an, die Exporte enthalten jedoch immer die vollständige Liste. Sie können die Ergebnisse in die Zwischenablage kopieren oder als CSV oder JSON herunterladen, um sie in einer Tabellenkalkulation, einem Skript oder einer umfangreicheren Analyse-Pipeline weiterzuverwenden.
Praktischer Nutzen von Häufigkeitsdaten
Häufigkeitsanalysen beantworten praktische Fragen schnell. Ein SEO-Redakteur kann prüfen, ob eine Zielphrase tatsächlich oft genug vorkommt — oder viel zu oft, was als Keyword-Stuffing gewertet wird. Ein Content-Team kann Kundenbewertungen oder Support-Tickets nach wiederkehrenden Bigrammen durchsuchen, die häufige Beschwerden oder Funktionswünsche aufdecken. Forschende nutzen N-Gramm-Zählungen, um Schreibstile zu vergleichen, den Wortschatzreichtum zu messen oder Basisverteilungen zu erstellen. Da das Tool saubere CSV- und JSON-Dateien exportiert, eignet es sich zugleich als leichtgewichtiger erster Schritt vor einer tiefergehenden Analyse in Python, R oder einem Notebook.
Privatsphäre von Anfang an
Alles läuft vollständig in Ihrem Browser ab. Der eingefügte Text wird mithilfe von clientseitigem JavaScript direkt auf Ihrem eigenen Gerät tokenisiert und gezählt — ohne Upload zu einem Server, ohne Konto und ohne Nutzungslimit. Sie können einen unveröffentlichten Entwurf, interne Dokumente oder vertrauliche Transkripte analysieren, ohne dass die Inhalte Ihr Gerät jemals verlassen, und die Seite funktioniert nach dem Laden auch offline weiter. Die Verarbeitungsgeschwindigkeit hängt von Ihrer Hardware ab, nicht von einer Server-Warteschlange, sodass selbst lange Dokumente in Echtzeit verarbeitet werden.