Probador de Robots.txt

Prueba y valida archivos robots.txt. Comprueba si las URLs están permitidas o bloqueadas para cualquier rastreador, analiza directivas y prueba varias URLs a la vez.

Actualizado

Share:
Home/SEO Tools/Robots.txt Tester

Robots.txt Tester

Test and validate robots.txt files. Check if specific URLs are allowed or blocked for any crawler, parse directives, detect issues, and bulk-test multiple URLs.

Sample Presets

Robots.txt Content

Test Settings

Preguntas Frecuentes

¿Qué comprueba?

Analiza tu robots.txt y verifica si determinadas URLs estarían permitidas o bloqueadas para cualquier rastreador (user-agent), aplicando reglas de coincidencia al estilo de Google.

¿Cómo funciona la coincidencia?

Gana la regla coincidente más específica (la más larga). Con igual especificidad, Allow prevalece sobre Disallow. Admite comodines * y anclas de fin de URL $.

¿Puedo probar varias URLs?

Sí: la pestaña de prueba masiva de URLs acepta varias URLs y muestra el veredicto PERMITIDO/BLOQUEADO por cada URL con recuentos de resumen.

¿El Probador de Robots.txt es gratis?

Sí, el Probador de Robots.txt es 100 % gratis, sin registro, sin cargos ocultos y sin límites de uso. Todo el procesamiento ocurre localmente en tu navegador, garantizando una privacidad total.

¿Mis datos están seguros con esta herramienta?

Por supuesto. El Probador de Robots.txt procesa todo del lado del cliente, en tu navegador. No se sube ni almacena ningún dato en ningún servidor. Tu contenido permanece privado en tu dispositivo en todo momento.

¿El Probador de Robots.txt funciona en dispositivos móviles?

Sí, el Probador de Robots.txt es totalmente adaptable y funciona en smartphones y tablets. Puedes usarlo en cualquier dispositivo con un navegador web moderno, sin necesidad de descargar ninguna app.

¿Necesito crear una cuenta para usar esta herramienta?

No hace falta cuenta ni registro. Simplemente abre el Probador de Robots.txt en tu navegador y empieza a usarlo de inmediato. No hay muros de registro ni restricciones de uso.

¿Esta herramienta sigue las directrices más recientes de Google?

Sí, el Probador de Robots.txt está desarrollado siguiendo las directrices y buenas prácticas actuales de Google Search. Actualizamos la herramienta con regularidad para reflejar los cambios en los requisitos de los motores de búsqueda.

¿Cómo uso el Probador de Robots.txt?

Solo tienes que introducir tu texto en el campo correspondiente, ajustar los parámetros según tus preferencias y la herramienta lo procesará al instante. Después puedes copiar el resultado al portapapeles o descargarlo.

¿Qué navegadores son compatibles?

El Probador de Robots.txt funciona en todos los navegadores modernos, incluidos Chrome, Firefox, Safari, Edge y Opera. Para una mejor experiencia, usa la última versión de tu navegador preferido.

¿Cuál es la diferencia entre bloquear una página en robots.txt y añadir una etiqueta noindex?

Robots.txt controla el rastreo, no la indexación. Una regla Disallow indica a los rastreadores que no soliciten una URL, pero no la elimina de los resultados de búsqueda: si otras páginas enlazan a ella, Google puede seguir indexando ese enlace sin descripción, ya que nunca tuvo permiso para leer la página. Una etiqueta meta noindex o una cabecera HTTP, en cambio, permite que el rastreador acceda a la página y luego la excluye explícitamente del índice. El problema es que noindex solo funciona si la página es rastreable, así que bloquearla en robots.txt impide directamente que Google llegue a ver la directiva noindex. Para ocultar una página de forma fiable, permite su rastreo y usa noindex; para ahorrar presupuesto de rastreo en URLs realmente inútiles, usa Disallow. Esta herramienta te muestra el veredicto exacto de PERMITIDO o BLOQUEADO para que puedas confirmar que una página es accesible antes de confiar en noindex.

¿Qué significan los comodines * y $ en una regla de robots.txt?

El asterisco (*) coincide con cualquier secuencia de caracteres, y el símbolo de dólar ($) ancla una regla al final de la ruta de la URL. Juntos permiten que una sola línea cubra muchas URLs. Por ejemplo, Disallow: /*?sort= bloquea cualquier ruta que contenga un parámetro sort, algo muy útil para las URLs de búsqueda facetada y filtros que generan páginas duplicadas infinitas. Disallow: /*.pdf$ bloquea únicamente las URLs que terminan en .pdf, de modo que una ruta como /guia.pdf?ref=email no coincidiría, porque hay algo después de la extensión. Google y la mayoría de los rastreadores modernos admiten ambos símbolos, pero es fácil equivocarse de forma sutil, y un comodín mal colocado puede bloquear muchísimo más de lo que pretendías. Pega tu archivo y prueba una URL de ejemplo aquí para comprobar si tu regla con comodín coincide como esperas.

¿Cómo bloqueo rastreadores de IA como GPTBot sin bloquear a Google?

Se hace apuntando a cada bot por su nombre en su propio grupo de user-agent. Los rastreadores de búsqueda y los rastreadores de entrenamiento de IA usan cadenas de user-agent distintas, así que una regla en uno no afecta al otro. Para que Googlebot y Bingbot sigan indexando tu sitio mientras dejas fuera a los bots de IA, deja User-agent: * en Allow y añade grupos separados con Disallow: / para agentes como GPTBot, ChatGPT-User, Google-Extended, anthropic-ai, ClaudeBot, CCBot, PerplexityBot y Bytespider. Como gana el grupo de coincidencia más específico, cada bot con nombre propio sigue su propio bloqueo mientras los buscadores se mantienen bajo la regla permisiva por defecto. Ten en cuenta que el cumplimiento es voluntario: los bots que se comportan bien respetan robots.txt, pero no es una barrera de seguridad. Esta herramienta incluye un preset de Bloquear bots de IA y te permite simular cada rastreador individualmente para confirmar que los buscadores siguen permitidos mientras los bots de IA quedan bloqueados.

¿Por qué mi robots.txt se está ignorando o no funciona?

El motivo más habitual es la ubicación: un archivo robots.txt debe estar en la raíz del host que gobierna, exactamente en /robots.txt, y las reglas se aplican por protocolo, subdominio y puerto. Un archivo en /carpeta/robots.txt o uno alojado en el dominio raíz no controlará un subdominio. Otros fallos silenciosos habituales son: líneas Allow o Disallow colocadas antes de cualquier línea User-agent (los rastreadores las ignoran), grupos de user-agent duplicados que se fusionan de forma inesperada, una regla Allow inalcanzable porque queda eclipsada por un Disallow más específico, y la ausencia del grupo por defecto User-agent: *. Los errores tipográficos en los nombres de directivas y los valores negativos de Crawl-delay también se descartan con frecuencia. Esta herramienta analiza todo tu archivo, señala estos problemas estructurales con su número de línea y nombra la directiva exacta que decide cada URL, para que puedas identificar por qué una regla no se comporta como esperabas.

¿El Crawl-delay en robots.txt realmente ralentiza a Googlebot?

No: Google no admite la directiva Crawl-delay y la ignora por completo, así que añadirla no cambiará la velocidad a la que Googlebot solicita tus páginas. Para ajustar la velocidad de rastreo de Google se depende de su rastreo adaptativo automático, que responde a la velocidad de tu servidor y a las respuestas de error. Sin embargo, Crawl-delay sí es respetado por otros rastreadores, entre ellos Bingbot y Yandex, donde establece el número mínimo de segundos que un bot espera entre solicitudes. Un valor negativo no es válido y se descarta. Como el soporte varía según el motor, conviene confirmar qué rastreador lee la directiva y qué valor se le aplica. Esta herramienta muestra el valor de Crawl-delay para el user-agent que selecciones, lo analiza a partir de tu archivo y te avisa de los valores negativos no válidos, para que puedas ver de un vistazo a qué bots afecta realmente tu retardo.

Acerca del Verificador de Robots.txt

El Verificador de Robots.txt es una herramienta gratuita para comprobar exactamente cómo va a interpretar un buscador o un rastreador de IA las reglas de tu archivo robots.txt. Pega el contenido de un robots.txt, elige un rastreador e introduce una URL: la herramienta devuelve al instante un veredicto de PERMITIDO o BLOQUEADO, indica la directiva que lo ha decidido y señala el número de línea exacto. Está pensada para SEOs, desarrolladores y propietarios de sitios que necesitan confirmar que las páginas importantes son rastreables y que las rutas de administración, las URLs de búsqueda facetada o los bots de entrenamiento de IA quedan fuera.

Un archivo robots.txt es un archivo de texto plano ubicado en la raíz de un dominio (/robots.txt) que indica a los rastreadores qué rutas pueden o no solicitar. Controla el rastreo, no la indexación: una URL bloqueada puede seguir apareciendo en los resultados de búsqueda si otras páginas enlazan a ella, que es precisamente el tipo de comportamiento sutil que esta herramienta te ayuda a entender antes de publicar un cambio.

Todo se ejecuta localmente en tu navegador. El robots.txt que pegas y las URLs que pruebas nunca se suben a un servidor, así que puedes comprobar reglas de un sitio de staging aún no publicado con total seguridad. No hace falta registrarse ni hay límite de uso, y puedes copiar o descargar el archivo en el que estás trabajando como robots.txt.

Cómo funciona la comprobación de permitido/bloqueado

La herramienta aplica el algoritmo de coincidencias de Google, de modo que el veredicto refleja el comportamiento real de Googlebot y de la mayoría de los rastreadores modernos:

  • Gana la regla más específica. Cuando varias líneas Allow y Disallow coinciden con una URL, se aplica la que tiene la ruta más larga (sin contar los comodines).
  • En caso de empate, Allow vence a Disallow. Si un Allow y un Disallow son igual de específicos, la URL queda permitida.
  • Se admiten comodines. El asterisco (*) coincide con cualquier secuencia de caracteres y el símbolo $ ancla la coincidencia al final de la URL, de modo que Disallow: /*.pdf$ bloquea específicamente los archivos PDF.
  • Los grupos de user-agent específicos anulan al grupo *. Si el rastreador que seleccionas tiene su propio bloque de reglas, la herramienta lo usa en lugar de las reglas genéricas.

Puedes probar una URL a la vez o cambiar a la pestaña Prueba masiva, pegar muchas URLs (una por línea) y obtener un veredicto por cada una junto con un recuento resumen de cuántas están permitidas y cuántas bloqueadas.

Rastreadores que puedes simular

La herramienta incluye los user-agents más relevantes de hoy, entre ellos Googlebot, Googlebot-Image, Bingbot, Applebot, DuckDuckBot, Yandex y Baiduspider, además de rastreadores de IA como GPTBot y ChatGPT-User. También puedes escribir cualquier cadena de user-agent personalizada. Esto hace muy sencillo confirmar que dejas pasar a los buscadores mientras bloqueas los bots de entrenamiento de IA, un objetivo habitual que cubre el preset integrado "Bloquear bots de IA".

Validación, reglas analizadas y presets

Más allá del veredicto, la herramienta analiza todo tu archivo y señala problemas que rompen el rastreo de forma silenciosa:

  • Falta el grupo por defecto User-agent: *.
  • Grupos de user-agent duplicados que terminan fusionándose.
  • Líneas Allow o Disallow que aparecen antes de cualquier línea User-agent y que, por tanto, se ignoran.
  • Directivas no válidas o no reconocidas, y valores negativos de Crawl-delay.
  • Reglas Allow potencialmente inalcanzables porque quedan eclipsadas por un Disallow más específico.

También lista cada grupo analizado, muestra qué directivas se aplican al rastreador seleccionado, saca a la luz cualquier entrada Sitemap y Host, y muestra el Crawl-delay para ese bot. Para empezar rápido, carga un preset (Permitir todo, Bloquear todo, Bloquear bots de IA, WordPress estándar, o un archivo complejo al estilo Google con varios grupos, comodines y anclajes) y edítalo para adaptarlo a tu propio sitio antes de volver a probarlo.

Pega tu robots.txt arriba, elige un rastreador y prueba una URL para ver el veredicto y la regla exacta que hay detrás.