Herramienta SEO gratuita
Probador local de robots.txt por ruta y crawler
Pega un robots.txt y comprueba una ruta con el intérprete local. El resultado sirve para una revisión preliminar y no reproduce todos los detalles de Google u otros crawlers.
Alcance del intérprete local
Esta herramienta lee el texto pegado en el navegador. Reconoce grupos
User-agent, reglas Allow y
Disallow, Sitemap, el comodín * y
$ al final de una regla.
El resultado no equivale al probador de un crawler. El parser no descarga el archivo, no comprueba su ubicación, estado HTTP, codificación o tamaño, y usa una selección simplificada de grupos. Tampoco combina bloques repetidos para el mismo crawler ni resuelve empates de igual longitud como lo hace Google. Los paths se comparan con mayúsculas y minúsculas, sin normalización de caracteres escapados.
Revisa cualquier caso de publicación contra la
especificación de robots.txt que interpreta Google. La propia documentación de Google indica que
crawl-delay no es una directiva admitida por Googlebot. Aquí
se muestra como dato, pero no cambia el resultado.
Contenido de robots.txt
Prueba de una ruta
Comprobaciones antes de publicar
Bloquear archivos CSS y JS
Una regla sobre /assets/ o /static/ puede
impedir que Googlebot obtenga recursos necesarios para renderizar la
página. Comprueba los paths reales antes de bloquear carpetas completas.
Separar cada crawler por función
Los nombres de crawler no son intercambiables. Confirma el token oficial y su función antes de crear un bloque. Una regla para un bot no describe el comportamiento de todos los productos de la misma empresa.
Diferencias por la barra final
Disallow: /blog también coincide con
/blogging. Disallow: /blog/ se limita a paths
que empiezan con esa carpeta. Prueba ejemplos que deban quedar dentro y
fuera del bloqueo.
URL completa del sitemap
La directiva Sitemap acepta una URL absoluta y no pertenece
a un grupo concreto de User-agent. Comprueba que la URL
publicada responda y corresponda al host correcto.
Controles de acceso independientes
robots.txt es público y no protege contenido sensible. Usa autenticación y permisos en el servidor cuando el acceso deba estar restringido. Gestiona la indexación con el mecanismo apropiado para una URL que Google pueda rastrear.
