Extractor de N-Gramas

Extrae y analiza n-gramas de palabras y caracteres (unigramas, bigramas, trigramas, 4-gramas, 5-gramas) con recuentos de frecuencia, porcentajes y métricas de diversidad.

Actualizado

Share:

Input Text

0 characters

Options

Total N-grams

0

Unique N-grams

0

Diversity Ratio

0.0%

N-gram Table
word-2gram

Enter text above to extract n-grams.

Preguntas Frecuentes

¿Qué es un n-grama?

Una secuencia contigua de n elementos (palabras o caracteres). Unigramas = palabras sueltas, bigramas = pares, trigramas = tríos. Los n-gramas son fundamentales para el PLN y el modelado del lenguaje.

¿N-gramas de palabras o de caracteres?

Los n-gramas de palabras son secuencias de palabras ("machine learning" es un bigrama de palabras). Los n-gramas de caracteres son secuencias de caracteres, especialmente útiles para la detección de idiomas y la coincidencia aproximada.

¿Qué es el índice de diversidad?

La relación tipo-token: el porcentaje de n-gramas únicos respecto al total. Más alto = mayor variedad léxica; más bajo = repetición. Una medida clásica en lingüística de corpus.

¿El Extractor de N-Gramas es gratuito?

Sí, el Extractor de N-Gramas es 100% gratuito, sin registro, sin tarifas ocultas y sin límites de uso. Todo el procesamiento ocurre localmente en tu navegador, garantizando total privacidad.

¿Están seguros mis datos con esta herramienta?

Por supuesto. El Extractor de N-Gramas procesa todo del lado del cliente, en tu navegador. No se sube ni se almacena ningún dato en ningún servidor. Tu contenido permanece privado en tu dispositivo en todo momento.

¿El Extractor de N-Gramas funciona en dispositivos móviles?

Sí, el Extractor de N-Gramas es totalmente adaptable y funciona en smartphones y tablets. Puedes usarlo en cualquier dispositivo con un navegador web moderno, sin necesidad de descargar ninguna app.

¿Necesito crear una cuenta para usar esta herramienta?

No se necesita ninguna cuenta ni registro. Simplemente abre el Extractor de N-Gramas en tu navegador y empieza a usarlo de inmediato. No hay muros de registro ni restricciones de uso.

¿Puedo procesar grandes cantidades de texto?

Sí, el Extractor de N-Gramas maneja textos de cualquier longitud con un procesamiento rápido y en tiempo real. Como todo se ejecuta en tu navegador, el rendimiento depende de tu dispositivo, pero funciona bien para la mayoría de los casos.

¿Cómo uso el Extractor de N-Gramas?

Simplemente introduce tu texto en el campo correspondiente, ajusta las opciones a tu preferencia y la herramienta lo procesará al instante. Luego puedes copiar el resultado al portapapeles o descargarlo.

¿Qué navegadores son compatibles?

El Extractor de N-Gramas funciona en todos los navegadores modernos, incluidos Chrome, Firefox, Safari, Edge y Opera. Para una mejor experiencia, usa la última versión de tu navegador preferido.

¿Por qué debería eliminar las palabras vacías antes de extraer n-gramas?

Las palabras vacías (stop words) son palabras funcionales comunes como "el", "de", "y" y "a" que aparecen constantemente pero aportan poco significado. Si las dejas, tus bigramas y trigramas principales se llenan de combinaciones como "de la" o "en el" que ahogan las frases que realmente te interesan. Al activar la opción de eliminar palabras vacías, estos tokens se descartan antes del recuento, de modo que secuencias con significado como "natural language processing" suben a lo más alto de la clasificación. Esto es especialmente útil para el análisis de palabras clave SEO y la detección de temas, donde buscas las frases sustantivas y no el pegamento gramatical. Para trabajo lingüístico o estilométrico puro puede convenirte conservar las palabras vacías, ya que su frecuencia es en sí misma una señal. Activa o desactiva la opción en esta herramienta y observa cómo se actualiza la clasificación al instante para comparar ambas vistas.

¿Cuál es la diferencia práctica entre unigramas, bigramas y trigramas?

Los tres son n-gramas de palabras; el número solo define la longitud de la secuencia. Los unigramas son palabras individuales, así que su tabla de frecuencia es esencialmente un recuento de palabras que muestra qué términos dominan un texto. Los bigramas son pares de dos palabras como "machine learning" y empiezan a revelar frases y colocaciones en lugar de palabras aisladas. Los trigramas son secuencias de tres palabras como "natural language processing" y capturan expresiones recurrentes aún más específicas, aunque los recuentos bajan a medida que crece la longitud porque las coincidencias exactas más largas son más raras. En resumen: los n-gramas pequeños muestran vocabulario, los grandes muestran fraseo. Esta herramienta también admite cuadrigramas y 5-gramas para detectar frases largas repetidas o texto genérico (boilerplate). Cambia entre los tamaños del uno al cinco usando las pestañas y compara cómo varía la clasificación para elegir el nivel que mejor se adapte a tu análisis.

¿Por qué cambian mis recuentos de n-gramas al activar los n-gramas entre oraciones?

Por defecto, esta herramienta no permite que un n-grama cruce el límite de una oración, así que la última palabra de una oración nunca se combina con la primera palabra de la siguiente. Esto evita que palabras sin relación entre sí se unan en frases que en realidad nunca ocurren juntas, lo que mantiene precisos los recuentos de bigramas y trigramas para el análisis de frases. Cuando activas la opción de permitir n-gramas entre oraciones, las secuencias se cuentan de forma continua a lo largo de todo el texto, sin tener en cuenta los puntos, por lo que obtienes más n-gramas en total y algunos pares nuevos que conectan el final de una oración con el principio de otra. Usa la configuración predeterminada para un análisis limpio de frases y colocaciones, y activa el conteo entre oraciones cuando quieras estadísticas de secuencias en bruto sobre todo el documento, como en ciertos experimentos de modelado del lenguaje. Actívalo o desactívalo aquí y los totales y la clasificación se recalculan de inmediato para que veas el efecto.

¿Cómo exporto los datos de frecuencia de n-gramas a una hoja de cálculo o un script?

Después de analizar tu texto, usa los botones de descarga para guardar los resultados completos en CSV o en JSON. El archivo CSV se abre directamente en Excel, Google Sheets o Numbers, con columnas para el n-grama, su recuento y su porcentaje, listo para ordenar, graficar o usar en tablas dinámicas. El archivo JSON está estructurado para código e incluye los n-gramas junto con cifras de resumen como el total, los únicos y la relación de diversidad, lo que facilita cargarlo en Python, R o un script de Node para un análisis más profundo. Aunque la tabla en pantalla se limita a 500 filas por motivos de rendimiento, los archivos exportados siempre contienen la lista completa de cada n-grama encontrado, así que no se pierde nada. También puedes copiar los resultados al portapapeles para pegarlos rápidamente. Procesa tu texto en esta herramienta y descarga el formato que mejor se adapte a tu flujo de trabajo.

¿Qué tan preciso es el Extractor de N-Gramas para el análisis de densidad de palabras clave en SEO?

Es preciso como contador de frecuencia literal: informa exactamente cuántas veces aparece cada palabra y frase, y qué porcentaje del total representa cada una, que es la base honesta de la densidad de palabras clave. La columna de porcentaje te indica si una frase objetivo aparece con la frecuencia suficiente para ser relevante, o con tanta frecuencia que se lee como keyword stuffing. Para resultados SEO fiables, activa la eliminación de puntuación y unifica mayúsculas y minúsculas para que variantes como "Apple" y "apple." se cuenten como un solo token, y considera eliminar las palabras vacías para hacer aflorar las frases temáticas reales. Recuerda que la frecuencia por sí sola no es un factor de posicionamiento; los motores de búsqueda modernos ponderan el contexto y la intención, así que trata estos recuentos como un diagnóstico, no como una cuota que cumplir. Pega aquí tu borrador o la página de un competidor, revisa las tablas de bigramas y trigramas, y ajusta tu redacción con confianza.

Acerca del Extractor de N-Gramas

El Extractor de N-Gramas descompone cualquier bloque de texto en sus secuencias repetidas y cuenta cuántas veces aparece cada una. Pega un artículo, una transcripción, un conjunto de reseñas de producto o una exportación de consultas de búsqueda, y la herramienta devuelve tablas clasificadas de n-gramas de palabras y de caracteres, junto con recuentos de frecuencia, porcentajes y una puntuación de diversidad léxica. Está pensada para redactores SEO que revisan la repetición de frases, lingüistas y estudiantes que analizan corpus, y desarrolladores que prototipan cualquier proyecto que dependa de datos de frecuencia.

Un n-grama es una secuencia contigua de n elementos extraídos de un texto. Un unigrama es una sola palabra, un bigrama es un par como "machine learning", y un trigrama es una tripleta como "natural language processing". La misma idea se aplica a los caracteres, donde "th", "the" y "ther" son n-gramas de caracteres de 2, 3 y 4 posiciones. Estas secuencias son la materia prima detrás del autocompletado, la detección de idioma, los filtros antispam y los modelos estadísticos del lenguaje que precedieron a los sistemas neuronales actuales.

Qué puedes extraer y ajustar

La herramienta trabaja en dos niveles a la vez, cada uno en su propia pestaña:

  • N-gramas de palabras de tamaño 1 a 5 — unigrama, bigrama, trigrama, cuadrigrama y 5-grama.
  • N-gramas de caracteres de 1 a 5 caracteres, independientes de los límites entre palabras y útiles para la coincidencia difusa (fuzzy matching) y la identificación de idiomas.

Varias opciones cambian cómo se tokeniza el texto antes de contarlo:

  • Sensibilidad a mayúsculas — mantén "Apple" y "apple" como términos separados, o únelos en uno solo (opción predeterminada).
  • Eliminar palabras vacías (stop words) — descarta palabras funcionales comunes como "el", "de" y "y" para que las frases con significado real destaquen.
  • Eliminar puntuación — quita los símbolos para que "palabra." y "palabra" se traten como el mismo token.
  • Permitir n-gramas entre oraciones — por defecto, las secuencias no cruzan el límite de una oración, lo que evita unir frases sin relación entre sí; activa esta opción para contar a lo largo de todo el texto sin esa restricción.
  • Filtro de recuento mínimo — oculta secuencias que aparecen una sola vez y muestra solo los n-gramas que se repiten al menos un número determinado de veces.

Qué te dicen los resultados

Cada pestaña muestra tres cifras principales: total de n-gramas (cada secuencia encontrada), n-gramas únicos (secuencias distintas) y la relación de diversidad. Esa relación es el type-token ratio: únicos dividido entre total, expresado como porcentaje. Un valor alto indica un vocabulario variado; un valor bajo señala repetición, que puede significar un texto conciso y enfocado o uno relleno y formulaico.

Debajo de las estadísticas, un gráfico de barras destaca las diez secuencias más frecuentes, y una tabla completa lista cada n-grama con su posición, su recuento y su porcentaje del total. La tabla muestra hasta 500 filas en pantalla por motivos de rendimiento, pero las exportaciones siempre contienen la lista completa. Puedes copiar los resultados al portapapeles o descargarlos en CSV o JSON para usarlos en una hoja de cálculo, un script o un flujo de análisis más amplio.

Usos reales de los datos de frecuencia

El análisis de frecuencia responde preguntas prácticas con rapidez. Un editor SEO puede confirmar si una frase objetivo aparece con la frecuencia adecuada, o con demasiada frecuencia, lo que se lee como keyword stuffing. Un equipo de contenido puede revisar reseñas de clientes o tickets de soporte en busca de bigramas recurrentes que revelen quejas frecuentes o solicitudes de funciones. Los investigadores usan los recuentos de n-gramas para comparar estilos de escritura, medir la riqueza del vocabulario o construir distribuciones de referencia. Como la herramienta exporta CSV y JSON limpios, también funciona como un primer paso ligero antes de un análisis más profundo en Python, R o un notebook.

Privado por diseño

Todo se ejecuta por completo en tu navegador. El texto que pegas se tokeniza y se cuenta en tu propio dispositivo mediante JavaScript del lado del cliente, sin subirlo a ningún servidor, sin necesidad de cuenta y sin límite de uso. Puedes analizar un borrador inédito, documentos internos o transcripciones confidenciales sin que el contenido salga jamás de tu equipo, y la página sigue funcionando sin conexión una vez que ha cargado. La velocidad de procesamiento depende de tu hardware y no de una cola en un servidor, así que incluso los documentos largos se procesan en tiempo real.