Herramienta SEO gratuita

Probador local de robots.txt por ruta y crawler

Pega un robots.txt y comprueba una ruta con el intérprete local. El resultado sirve para una revisión preliminar y no reproduce todos los detalles de Google u otros crawlers.

Alcance del intérprete local

Esta herramienta lee el texto pegado en el navegador. Reconoce grupos User-agent, reglas Allow y Disallow, Sitemap, el comodín * y $ al final de una regla.

El resultado no equivale al probador de un crawler. El parser no descarga el archivo, no comprueba su ubicación, estado HTTP, codificación o tamaño, y usa una selección simplificada de grupos. Tampoco combina bloques repetidos para el mismo crawler ni resuelve empates de igual longitud como lo hace Google. Los paths se comparan con mayúsculas y minúsculas, sin normalización de caracteres escapados.

Revisa cualquier caso de publicación contra la especificación de robots.txt que interpreta Google. La propia documentación de Google indica que crawl-delay no es una directiva admitida por Googlebot. Aquí se muestra como dato, pero no cambia el resultado.

R Contenido de robots.txt

? Prueba de una ruta

! Comprobaciones antes de publicar

Bloquear archivos CSS y JS

Una regla sobre /assets/ o /static/ puede impedir que Googlebot obtenga recursos necesarios para renderizar la página. Comprueba los paths reales antes de bloquear carpetas completas.

Separar cada crawler por función

Los nombres de crawler no son intercambiables. Confirma el token oficial y su función antes de crear un bloque. Una regla para un bot no describe el comportamiento de todos los productos de la misma empresa.

Diferencias por la barra final

Disallow: /blog también coincide con /blogging. Disallow: /blog/ se limita a paths que empiezan con esa carpeta. Prueba ejemplos que deban quedar dentro y fuera del bloqueo.

URL completa del sitemap

La directiva Sitemap acepta una URL absoluta y no pertenece a un grupo concreto de User-agent. Comprueba que la URL publicada responda y corresponda al host correcto.

Controles de acceso independientes

robots.txt es público y no protege contenido sensible. Usa autenticación y permisos en el servidor cuando el acceso deba estar restringido. Gestiona la indexación con el mecanismo apropiado para una URL que Google pueda rastrear.