Lematizador de inglés y stemmer de Porter

Reduce las palabras en inglés a su forma base con el algoritmo de Porter o un lematizador basado en reglas. Compara ambos lado a lado.

Actualizado

Share:

English Lemmatizer / Stemmer

Reduce English words to their base forms with the Porter stemmer or a rule-based lemmatizer. All processing stays in your browser.

Input text

Output

Porter stem
No text
Lemma
No text

Preguntas Frecuentes

¿Qué es el Lematizador de inglés y Porter Stemmer?

El Lematizador de inglés y Porter Stemmer es una herramienta online gratuita que reduce las palabras en inglés a su forma base mediante el algoritmo Porter Stemmer o un lematizador basado en reglas. Compara ambos resultados lado a lado. Funciona por completo en tu navegador, sin necesidad de instalación ni registro.

¿Stemming o lematización?

El stemming corta las terminaciones de las palabras de forma heurística (running->run, studies->studi), por lo que los stems pueden no ser palabras reales. La lematización devuelve la forma base del diccionario (studies->study, went->go), y los lemas siempre lo son.

¿Qué algoritmo de stemming usa?

El clásico Porter Stemmer (Porter, 1980), implementado en tu navegador, con sus 5 pasos completos, incluidas las condiciones de medida m>0/m>1 y las pruebas *v*, *o y *d.

¿Se envía mi texto a un servidor?

No. Todo el stemming, la lematización y la exportación ocurren por completo en tu navegador. Tu texto nunca sale de tu dispositivo.

¿Es gratis usar el Lematizador de inglés y Porter Stemmer?

Sí, el Lematizador de inglés y Porter Stemmer es 100% gratis, sin registro, sin tarifas ocultas y sin límites de uso. Todo el procesamiento ocurre localmente en tu navegador, garantizando una privacidad total.

¿Están seguros mis datos con esta herramienta?

Por supuesto. El Lematizador de inglés y Porter Stemmer procesa todo del lado del cliente, en tu navegador. No se sube ni se almacena ningún dato en ningún servidor. Tu contenido permanece siempre privado en tu dispositivo.

¿Funciona el Lematizador de inglés y Porter Stemmer en dispositivos móviles?

Sí, el Lematizador de inglés y Porter Stemmer es totalmente adaptable y funciona en smartphones y tablets. Puedes usarlo en cualquier dispositivo con un navegador web moderno, sin necesidad de descargar ninguna app.

¿Necesito crear una cuenta para usar esta herramienta?

No se necesita cuenta ni registro. Simplemente abre el Lematizador de inglés y Porter Stemmer en tu navegador y empieza a usarlo de inmediato. No hay muros de registro ni restricciones de uso.

¿Puedo procesar grandes cantidades de texto?

Sí, el Lematizador de inglés y Porter Stemmer gestiona texto de cualquier longitud con un procesamiento rápido y en tiempo real. Como todo se ejecuta en tu navegador, el rendimiento depende de tu dispositivo, pero funciona bien para la mayoría de los casos.

¿Cómo uso el Lematizador de inglés y Porter Stemmer?

Simplemente introduce tu texto en el campo correspondiente, ajusta las opciones a tu gusto y la herramienta lo procesará al instante. Después puedes copiar el resultado al portapapeles o descargarlo.

¿Cuándo debería usar stemming en lugar de lematización?

Recurre al stemming cuando la velocidad y una reducción agresiva del vocabulario importan más que producir palabras reales. El stemming utiliza reglas simples de recorte de sufijos, por lo que es rápido y consistente — ideal para índices de búsqueda, modelos bag-of-words y tareas de recuperación de información donde "studies", "studied" y "studying" solo necesitan mapearse a un mismo token compartido, aunque ese token sea "studi". La lematización es la mejor opción cuando el resultado debe ser legible para humanos o gramaticalmente válido, como al mostrar términos normalizados, construir una lista de palabras clave limpia o alimentar un pipeline basado en diccionario, porque cada lema es una palabra real. Muchos flujos de trabajo de PLN usan el stemming para el emparejamiento (matching) y la lematización para la presentación. Esta herramienta ejecuta ambas a la vez en la pestaña Comparar y muestra un porcentaje de reducción independiente para cada una, para que puedas ver qué técnica se ajusta mejor a tu texto antes de decidirte.

¿Por qué el stemmer de Porter convierte "studies" en "studi" en lugar de "study"?

El stemmer de Porter es un algoritmo basado en reglas, no una búsqueda en diccionario, por lo que transforma las terminaciones según un patrón sin comprobar si el resultado es una palabra real. Para "studies" aplica la regla que cambia la terminación final "-ies" por "-i", produciendo "studi". Esa raíz es intencional: toda palabra que comparta la misma raíz se reduce al mismo token, que es todo lo que necesita un índice de búsqueda o un modelo de coincidencia de texto. Nunca se garantiza una palabra real — "argument" y "argue" pueden incluso derivar en raíces distintas. Si necesitas la forma válida de diccionario "study", usa en su lugar la lematización, que asigna "studies" a "study" mediante reglas de forma base. Cambia aquí a la pestaña Lematizador para obtener lemas legibles, o usa Comparar para ver la raíz y el lema de cada palabra uno junto al otro y detectar exactamente dónde divergen.

¿Qué hace la opción "Eliminar palabras vacías" y cuándo debería activarla?

El interruptor Eliminar palabras vacías descarta palabras funcionales muy comunes — como "the", "of", "and", "is" y "to" — antes de que la herramienta reduzca el resto de las palabras a raíces o lemas. Estas palabras aparecen en casi todas las oraciones pero aportan poco significado temático, así que filtrarlas deja los términos con contenido real que realmente distinguen un texto de otro. Actívala cuando estés construyendo un índice de búsqueda, extrayendo palabras clave, contando ideas distintas o preparando texto para un modelo bag-of-words, porque reduce el vocabulario y el ruido. Desactívala cuando necesites una reducción fiel, palabra por palabra, del texto original, como en un análisis lingüístico donde cada token importa. Combínala con las opciones Minúsculas primero y Conservar números para ajustar con precisión qué tokens sobreviven, y luego revisa el panel de estadísticas para ver cuántas palabras quedaron.

¿Qué me dice el porcentaje de reducción sobre mi texto?

El porcentaje de reducción mide cuánto se reduce tu vocabulario después de reducir cada palabra a su raíz. Compara el número de palabras originales únicas con el número de raíces o lemas únicos: si 200 palabras distintas se reducen a 150 raíces distintas, eso equivale a una reducción del 25%. Un número más alto significa que tu texto contiene muchas variaciones flexionadas de las mismas raíces — plurales, tiempos verbales y comparativos — por lo que contiene menos ideas verdaderamente distintas de las que sugiere el recuento de palabras en bruto. Esta herramienta muestra una cifra de reducción independiente para el stemming y para la lematización, ya que el stemmer, al ser más agresivo, normalmente reduce más. La métrica es útil para evaluar la riqueza léxica, dimensionar un índice de búsqueda o comprobar si un texto se apoya en conceptos repetidos. Pega un fragmento y observa cómo el panel de estadísticas actualiza la reducción en tiempo real a medida que ajustas las opciones.

¿Puede el lematizador manejar palabras irregulares como "went", "feet" o "better"?

Sí. El lematizador combina reglas de sufijos para terminaciones regulares con un diccionario integrado de formas irregulares comunes, por lo que resuelve palabras que las reglas simples pasarían por alto. Los verbos irregulares se asignan a su forma base — "went" se convierte en "go" y "bought" se convierte en "buy" — los plurales irregulares se gestionan, con "feet" convirtiéndose en "foot" y "mice" convirtiéndose en "mouse", y los comparativos y superlativos irregulares también se reducen, de modo que tanto "better" como "best" se convierten en "good". Las terminaciones regulares como "-s", "-es", "-ies", "-ed", "-ing", "-er" y "-est" se eliminan mediante reglas. Como es un lematizador ligero y determinista, y no un etiquetador gramatical completo, funciona sin contexto de la oración, lo que lo mantiene rápido y predecible. Carga la oración de ejemplo incluida para ver verbos irregulares, plurales y comparativos normalizados en una sola pasada antes de pegar tu propio texto.

Embed This Tool

Add a free, live version of this widget to your own website or blog post — it runs entirely in your visitors' browsers, with a credit link back to The Toolbox.

Copy & paste this HTML
<iframe src="https://getthetoolbox.com/embed/lemmatizer" title="English Lemmatizer & Porter Stemmer — The Toolbox" width="100%" height="300" style="max-width:480px;border:1px solid #e2e8f0;border-radius:12px" loading="lazy"></iframe>
<p style="font-size:12px;margin:4px 0 0"><a href="https://getthetoolbox.com/text-tools/lemmatizer?utm_source=embed&utm_medium=widget" target="_blank" rel="noopener">Free English Lemmatizer & Porter Stemmer</a> by The Toolbox</p>

Acerca del Lematizador en Inglés y el Stemmer de Porter

Esta herramienta reduce las palabras en inglés a su forma raíz de dos maneras distintas y te permite ver ambas a la vez. Pega cualquier texto en inglés y la herramienta pasa cada palabra por el clásico stemmer de Porter y por un lematizador basado en reglas, mostrando luego la palabra original, su raíz (stem) y su lema uno junto al otro. Está pensada para cualquiera que trabaje con texto a nivel de palabra — estudiantes que aprenden procesamiento de lenguaje natural, desarrolladores que preparan un índice de búsqueda o construyen un modelo bag-of-words, lingüistas y escritores que quieren contar cuántas ideas distintas contiene realmente un texto, en lugar de cuántas palabras superficiales utiliza.

Todo se ejecuta localmente en tu navegador. Tu texto nunca se sube a ningún servidor, no hace falta registrarse y no hay más límite de longitud que el que pueda soportar tu propio dispositivo, así que puedes procesar sin riesgo borradores inéditos, corpus propietarios o notas privadas.

Stemming y lematización, lado a lado

Las dos técnicas resuelven el mismo problema — reducir las formas flexionadas a una raíz compartida — pero lo hacen de manera distinta, y verlas juntas deja la diferencia muy clara.

  • El stemming recorta terminaciones aplicando heurísticas. El resultado es una raíz (stem), que no tiene por qué ser una palabra real. running se convierte en run, pero studies se convierte en studi y argument puede derivar de forma distinta a argue.
  • La lematización devuelve la forma base de diccionario, llamada lema, que siempre es una palabra válida. studies se convierte en study, went se convierte en go, children se convierte en child y better se convierte en good.

Usa la pestaña Comparar para ver una copia con stemming de tu párrafo junto a una copia lematizada, con cada palabra que cambió resaltada. Cambia a la pestaña Stemmer de Porter o Lematizador cuando solo quieras una de las dos transformaciones.

Qué hay bajo el capó

El stemmer es una implementación construida desde cero del algoritmo de stemming de Porter (Porter, 1980) — el mismo procedimiento de cinco pasos que se usa como referencia base en incontables sistemas de búsqueda y de PLN. Aplica el conjunto completo de condiciones, incluida la medida m (que cuenta las secuencias vocal-consonante), la prueba de contiene-una-vocal y las comprobaciones de consonante doble y *o cvc, de modo que coincide con el algoritmo canónico en lugar de limitarse a aproximarlo.

El lematizador combina un diccionario de formas irregulares comunes — verbos irregulares (wasbe, boughtbuy), plurales irregulares (feetfoot, micemouse, peopleperson) y comparativos y superlativos (worsebad, bestgood) — con reglas de sufijos para las terminaciones regulares -s, -es, -ies, -ed, -ing, -er y -est. Es un lematizador ligero y determinista, no un etiquetador gramatical completo, por lo que funciona sin contexto, tal como lo haría un pipeline de PLN en producción.

Opciones, estadísticas y exportación

Tres interruptores determinan el resultado: Minúsculas primero normaliza las mayúsculas y minúsculas antes de reducir, Eliminar palabras vacías descarta palabras funcionales comunes como the, of y and, y Conservar números decide si los tokens numéricos se cuentan. Mientras escribes, un panel de estadísticas informa el total de palabras, las palabras únicas, las raíces únicas, los lemas únicos, el porcentaje de reducción de la raíz (cuánto se redujo tu vocabulario) y cuántas filas duplicadas se combinaron.

Una tabla de palabras enumera cada token único con su raíz, su lema y una etiqueta de tipo de cambio (both, stem only, lemma only o none). Puedes copiar los resultados al portapapeles o descargarlos como CSV para usarlos en una hoja de cálculo o para alimentar un índice de búsqueda. Carga la oración de ejemplo incluida para ver verbos irregulares, plurales y comparativos procesados en una sola pasada antes de pegar tu propio texto.