Englischer Lemmatisierer und Porter-Stemmer
Reduzieren Sie englische Wörter mit dem Porter-Stemmer-Algorithmus oder einem regelbasierten Lemmatisierer auf ihre Grundform. Vergleichen Sie beide nebeneinander.
Aktualisiert am
English Lemmatizer / Stemmer
Reduce English words to their base forms with the Porter stemmer or a rule-based lemmatizer. All processing stays in your browser.
Input text
Output
Häufig gestellte Fragen
Was ist der englische Lemmatizer & Porter Stemmer?
Der englische Lemmatizer & Porter Stemmer ist ein kostenloses Online-Tool, das englische Wörter mit dem Porter-Stemmer-Algorithmus oder einem regelbasierten Lemmatizer auf ihre Grundform zurückführt. Vergleiche beide direkt nebeneinander. Es läuft vollständig in deinem Browser, ohne Installation oder Anmeldung.
Stemming oder Lemmatisierung?
Beim Stemming werden Wortendungen heuristisch abgeschnitten (running->run, studies->studi) – die Wortstämme sind nicht immer echte Wörter. Die Lemmatisierung liefert die Grundform aus dem Wörterbuch (studies->study, went->go), und Lemmata sind immer echte Wörter.
Welcher Stemming-Algorithmus?
Der klassische Porter Stemmer (Porter, 1980), in deinem Browser umgesetzt – mit allen 5 Schritten, einschließlich der Maßbedingungen m>0/m>1 sowie der Tests *v*, *o und *d.
Wird mein Text an einen Server gesendet?
Nein. Stemming, Lemmatisierung und Export laufen vollständig in deinem Browser ab. Dein Text verlässt niemals dein Gerät.
Ist der englische Lemmatizer & Porter Stemmer kostenlos nutzbar?
Ja, der englische Lemmatizer & Porter Stemmer ist zu 100% kostenlos, ohne Registrierung, ohne versteckte Gebühren und ohne Nutzungsbeschränkungen. Die gesamte Verarbeitung erfolgt lokal in deinem Browser und gewährleistet vollständige Privatsphäre.
Sind meine Daten mit diesem Tool sicher?
Absolut. Der englische Lemmatizer & Porter Stemmer verarbeitet alles clientseitig in deinem Browser. Es werden keine Daten auf einen Server hochgeladen oder dort gespeichert. Dein Inhalt bleibt jederzeit privat auf deinem Gerät.
Funktioniert der englische Lemmatizer & Porter Stemmer auf Mobilgeräten?
Ja, der englische Lemmatizer & Porter Stemmer ist vollständig responsiv und funktioniert auf Smartphones und Tablets. Du kannst ihn auf jedem Gerät mit einem modernen Webbrowser nutzen – ohne App-Download.
Muss ich ein Konto erstellen, um dieses Tool zu nutzen?
Es ist kein Konto und keine Registrierung erforderlich. Öffne einfach den englischen Lemmatizer & Porter Stemmer in deinem Browser und beginne sofort. Es gibt keine Anmeldehürden oder Nutzungsbeschränkungen.
Kann ich große Textmengen verarbeiten?
Ja, der englische Lemmatizer & Porter Stemmer verarbeitet Texte beliebiger Länge schnell und in Echtzeit. Da alles in deinem Browser läuft, hängt die Leistung von deinem Gerät ab, funktioniert aber für die meisten Anwendungsfälle gut.
Wie verwende ich den englischen Lemmatizer & Porter Stemmer?
Gib einfach deinen Text in das vorgesehene Feld ein, passe die Einstellungen nach Wunsch an, und das Tool verarbeitet ihn sofort. Anschließend kannst du das Ergebnis in die Zwischenablage kopieren oder herunterladen.
Wann sollte ich Stemming statt Lemmatisierung verwenden?
Greifen Sie zu Stemming, wenn Geschwindigkeit und eine aggressive Reduzierung des Vokabulars wichtiger sind als echte Wörter im Ergebnis. Stemming arbeitet mit einfachen Regeln zum Abschneiden von Endungen und ist dadurch schnell und konsistent – ideal für Suchindizes, Bag-of-Words-Modelle und Information Retrieval, bei denen "studies", "studied" und "studying" lediglich auf ein gemeinsames Token abgebildet werden müssen, selbst wenn dieses Token "studi" lautet. Lemmatisierung ist die bessere Wahl, wenn das Ergebnis lesbar oder grammatikalisch korrekt sein muss – etwa bei der Anzeige normalisierter Begriffe, beim Erstellen einer sauberen Keyword-Liste oder als Eingabe für eine wörterbuchbasierte Pipeline –, weil jedes Lemma ein echtes Wort ist. Viele NLP-Workflows nutzen Stemming zum Abgleichen und Lemmatisierung für die Darstellung. Dieses Tool führt beide Verfahren gleichzeitig im Tab Compare aus und gibt für jedes eine eigene Reduktionsrate an, sodass Sie erkennen können, welche Technik zu Ihrem Text passt, bevor Sie sich festlegen.
Warum macht der Porter-Stemmer aus "studies" "studi" statt "study"?
Der Porter-Stemmer ist ein regelbasierter Algorithmus und kein Wörterbuch-Nachschlagewerk – er verändert Endungen nach einem Muster, statt zu prüfen, ob das Ergebnis ein echtes Wort ist. Bei "studies" wendet er die Regel an, die ein abschließendes "-ies" in "-i" umwandelt, wodurch "studi" entsteht. Dieser Stamm ist beabsichtigt: Alle Wörter mit derselben Wurzel werden auf dasselbe Token reduziert, und genau das benötigt ein Suchindex oder ein Textabgleich-Modell. Ein echtes Wort ist dabei nie garantiert – "argument" und "argue" können sogar unterschiedlich gestemmt werden. Wenn Sie die gültige Wörterbuchform "study" benötigen, verwenden Sie stattdessen die Lemmatisierung, die "studies" anhand von Grundform-Regeln auf "study" abbildet. Wechseln Sie hier zum Tab Lemmatizer, um lesbare Lemmata zu erhalten, oder nutzen Sie Compare, um Stamm und Lemma für jedes Wort nebeneinander zu sehen und die Unterschiede genau zu erkennen.
Was bewirkt die Option "Remove stop words", und wann sollte ich sie aktivieren?
Der Schalter Remove stop words entfernt sehr häufige Funktionswörter – etwa "the", "of", "and", "is" und "to" –, bevor das Tool die verbleibenden Wörter auf Stämme oder Lemmata reduziert. Diese Wörter tauchen in fast jedem Satz auf, tragen aber kaum inhaltliche Bedeutung, sodass Sie nach dem Herausfiltern nur die bedeutungstragenden Begriffe behalten, die einen Text tatsächlich von einem anderen unterscheiden. Aktivieren Sie die Option, wenn Sie einen Suchindex aufbauen, Keywords extrahieren, eigenständige Ideen zählen oder Text für ein Bag-of-Words-Modell vorbereiten, da sie das Vokabular verkleinert und Rauschen reduziert. Lassen Sie sie deaktiviert, wenn Sie eine originalgetreue, Wort-für-Wort-Reduktion des Ausgangstexts benötigen, etwa bei einer linguistischen Analyse, bei der jedes Token zählt. Kombinieren Sie die Option mit Lowercase first und Keep numbers, um exakt zu steuern, welche Token erhalten bleiben, und prüfen Sie anschließend im Statistik-Panel, wie viele Wörter übrig geblieben sind.
Was sagt mir die Reduktionsrate über meinen Text?
Die Reduktionsrate misst, wie stark Ihr Vokabular schrumpft, nachdem jedes Wort auf seine Wurzel reduziert wurde. Sie vergleicht die Anzahl eindeutiger Originalwörter mit der Anzahl eindeutiger Stämme oder Lemmata: Wenn 200 unterschiedliche Wörter auf 150 unterschiedliche Stämme zusammenfallen, entspricht das einer Reduktion von 25 %. Ein höherer Wert bedeutet, dass Ihr Text viele flektierte Varianten derselben Wurzeln enthält – Plurale, Verbzeiten und Komparative –, sodass er weniger wirklich eigenständige Ideen transportiert, als die reine Wortzahl vermuten lässt. Dieses Tool weist für Stemming und für Lemmatisierung jeweils einen eigenen Reduktionswert aus, da der aggressivere Stemmer in der Regel stärker reduziert. Die Kennzahl eignet sich, um den lexikalischen Reichtum eines Texts einzuschätzen, einen Suchindex zu dimensionieren oder zu prüfen, ob ein Text sich stark wiederholender Konzepte bedient. Fügen Sie einen Textabschnitt ein und beobachten Sie, wie sich die Reduktion im Statistik-Panel live aktualisiert, während Sie die Optionen anpassen.
Kann der Lemmatizer mit unregelmäßigen Wörtern wie "went", "feet" oder "better" umgehen?
Ja. Der Lemmatizer kombiniert Endungsregeln für reguläre Formen mit einem integrierten Wörterbuch gängiger unregelmäßiger Formen und löst so auch Wörter auf, die einfache Regeln übersehen würden. Unregelmäßige Verben werden auf ihre Grundform abgebildet – aus "went" wird "go" und aus "bought" wird "buy" –, unregelmäßige Pluralformen werden ebenfalls erkannt, sodass aus "feet" "foot" und aus "mice" "mouse" wird, und auch unregelmäßige Komparative und Superlative werden reduziert, sodass sowohl "better" als auch "best" zu "good" werden. Reguläre Endungen wie "-s", "-es", "-ies", "-ed", "-ing", "-er" und "-est" werden per Regel entfernt. Da es sich um einen schlanken, deterministischen Lemmatizer und keinen vollständigen Part-of-Speech-Tagger handelt, arbeitet er ohne Satzkontext, was ihn schnell und vorhersehbar macht. Laden Sie den mitgelieferten Beispielsatz, um unregelmäßige Verben, Pluralformen und Komparative in einem einzigen Durchgang normalisiert zu sehen, bevor Sie eigenen Text einfügen.
Embed This Tool
Add a free, live version of this widget to your own website or blog post — it runs entirely in your visitors' browsers, with a credit link back to The Toolbox.
<iframe src="https://getthetoolbox.com/embed/lemmatizer" title="English Lemmatizer & Porter Stemmer — The Toolbox" width="100%" height="300" style="max-width:480px;border:1px solid #e2e8f0;border-radius:12px" loading="lazy"></iframe>
<p style="font-size:12px;margin:4px 0 0"><a href="https://getthetoolbox.com/text-tools/lemmatizer?utm_source=embed&utm_medium=widget" target="_blank" rel="noopener">Free English Lemmatizer & Porter Stemmer</a> by The Toolbox</p>Verwandte Tools
Kostenloser Wortzähler Online
Zählen Sie sofort Wörter, Zeichen, Sätze, Absätze und die Lesezeit. Kostenloser Online-Wortzähler. Läuft vollständig in Ihrem Browser, ganz ohne Anmeldung.
Kostenloser Groß-/Kleinschreibung-Konverter Online
Wandeln Sie Text in Groß-, Kleinschreibung, Titel- oder Satzschreibung um. Kostenloser Online-Konverter für Groß- und Kleinschreibung. Läuft vollständig in Ihrem Browser, ganz ohne Anmeldung.
Kostenloser Lorem-Ipsum-Generator
Erzeugen Sie Lorem-Ipsum-Platzhaltertext für Design- und Entwicklungsprojekte. Kostenlos, schnell und vollständig in Ihrem Browser, ganz ohne Anmeldung.
Kostenloser Entferner für doppelte Zeilen
Entfernen Sie doppelte Zeilen aus Ihrem Text unter Beibehaltung der Reihenfolge. Kostenloses Online-Tool. Läuft vollständig in Ihrem Browser, ganz ohne Anmeldung.
Über den English Lemmatizer & Porter Stemmer
Dieses Tool reduziert englische Wörter auf zwei unterschiedliche Arten auf ihre Grundform – und zeigt Ihnen beide Ergebnisse gleichzeitig. Fügen Sie einen beliebigen englischen Text ein, und das Tool führt jedes Wort durch den klassischen Porter-Stemmer und durch einen regelbasierten Lemmatizer, um anschließend Originalwort, Stamm und Lemma nebeneinander anzuzeigen. Es richtet sich an alle, die auf Wortebene mit Text arbeiten – Studierende, die sich mit Natural Language Processing beschäftigen, Entwickler, die einen Suchindex vorbereiten oder ein Bag-of-Words-Modell bauen, Linguisten sowie Autoren, die zählen möchten, wie viele eigenständige Ideen ein Text tatsächlich enthält, statt nur die Zahl der Oberflächenwörter zu betrachten.
Die gesamte Verarbeitung läuft lokal in Ihrem Browser ab. Ihr Text wird nie hochgeladen, eine Registrierung ist nicht nötig, und es gibt keine Längenbegrenzung außer der Leistungsfähigkeit Ihres eigenen Geräts – Sie können also bedenkenlos unveröffentlichte Entwürfe, urheberrechtlich geschützte Textkorpora oder private Notizen verarbeiten.
Stemming und Lemmatisierung im direkten Vergleich
Beide Verfahren lösen dasselbe Problem – sie führen flektierte Wortformen auf eine gemeinsame Wurzel zurück –, gehen dabei aber unterschiedlich vor. Erst im direkten Vergleich wird der Unterschied wirklich greifbar.
- Stemming schneidet Wortendungen anhand von Heuristiken ab. Das Ergebnis ist ein Stamm, der nicht zwangsläufig ein echtes Wort sein muss. Aus
runningwirdrun, ausstudiesjedochstudi, undargumentkann sich vonargueunterscheiden. - Lemmatisierung liefert die Wörterbuch-Grundform, das sogenannte Lemma, das immer ein gültiges Wort ist. Aus
studieswirdstudy, auswentwirdgo, auschildrenwirdchild, und ausbetterwirdgood.
Nutzen Sie den Tab Compare, um eine gestemmte Version Ihres Absatzes neben einer lemmatisierten Version zu betrachten, wobei jedes veränderte Wort hervorgehoben wird. Wechseln Sie zum Tab Porter Stemmer oder Lemmatizer, wenn Sie nur eine der beiden Transformationen benötigen.
Was steckt dahinter
Der Stemmer ist eine vollständige Eigenimplementierung des Porter-Stemming-Algorithmus (Porter, 1980) – desselben fünfstufigen Verfahrens, das als Baseline in unzähligen Such- und NLP-Systemen zum Einsatz kommt. Er wendet den kompletten Satz an Bedingungen an, darunter das m-Maß (das Zählen von Vokal-Konsonant-Sequenzen), den Vokal-Enthält-Test sowie die Prüfungen auf doppelte Konsonanten und das *o-cvc-Muster – er entspricht damit dem kanonischen Algorithmus, statt ihn nur anzunähern.
Der Lemmatizer kombiniert ein Wörterbuch gängiger unregelmäßiger Formen – unregelmäßige Verben (was→be, bought→buy), unregelmäßige Pluralformen (feet→foot, mice→mouse, people→person) sowie Komparative und Superlative (worse→bad, best→good) – mit Endungsregeln für die regulären Suffixe -s, -es, -ies, -ed, -ing, -er und -est. Es handelt sich um einen schlanken, deterministischen Lemmatizer und keinen vollständigen Part-of-Speech-Tagger, weshalb er wie eine produktive NLP-Pipeline ohne Kontext arbeitet.
Optionen, Statistiken und Export
Drei Schalter steuern den Ablauf: Lowercase first normalisiert die Groß-/Kleinschreibung vor der Reduktion, Remove stop words entfernt gängige Funktionswörter wie the, of und and, und Keep numbers legt fest, ob Zahlentoken mitgezählt werden. Während Sie tippen, meldet ein Statistik-Panel die Gesamtzahl der Wörter, die Anzahl eindeutiger Wörter, eindeutiger Stämme und eindeutiger Lemmata, die Reduktionsrate des Stemmings (wie stark Ihr Vokabular geschrumpft ist) sowie die Anzahl der zusammengefassten Dopplungen.
Eine Wörtertabelle listet jedes eindeutige Token mit seinem Stamm, seinem Lemma und einem Änderungs-Tag (both, stem only, lemma only oder none) auf. Sie können die Ergebnisse in die Zwischenablage kopieren oder als CSV herunterladen, um sie in einer Tabellenkalkulation weiterzuverarbeiten oder einen Suchindex damit zu befüllen. Laden Sie den mitgelieferten Beispielsatz, um unregelmäßige Verben, Pluralformen und Komparative in einem Durchgang verarbeitet zu sehen, bevor Sie eigenen Text einfügen.