News

Visitas de bots de IA: cómo medir crawl, referencias y adopción

Un marco verificable para medir bots de IA en logs, separar crawl de citas y referencias, y usar los datos de adopción de Stanford sin confundir correlación con resultados.

Actualizado 7 de agosto de 2026 Francisco Leon de Vivero
Visitas de bots de IA: cómo medir crawl, referencias y adopción

TL;DR: Una visita de GPTBot, OAI-SearchBot o PerplexityBot confirma una solicitud HTTP. No demuestra que la página haya sido citada, que haya enviado una sesión de referencia ni que esa sesión haya convertido. Cada resultado necesita una fuente de datos distinta.

Los datos de adopción del AI Index 2026 de Stanford justifican vigilar el canal, pero no permiten atribuir resultados de negocio al rastreo. El informe registra uso amplio de IA y, al mismo tiempo, despliegue de agentes todavía bajo en la mayoría de funciones empresariales.

Los informes sobre bots de IA suelen mezclar cuatro eventos. Un bot solicita una URL, un sistema usa el contenido en una respuesta, una persona hace clic y esa visita completa una acción. La secuencia parece lógica, pero ninguna etapa garantiza la siguiente.

Antes de invertir en una supuesta optimización para rastreadores, construiría una medición que conserve esas fronteras. Así se puede responder qué sistemas acceden al sitio, qué páginas reciben solicitudes y cuánto negocio llega realmente desde asistentes.

Separación entre crawl, cita, referencia y conversión

EventoFuente de evidenciaLo que no demuestra
Solicitud de un botLog de servidor o CDN con IP validadaCitación, visibilidad o visita humana
Mención o citaRespuesta guardada con consulta, fecha y productoQue hubo clic o conversión
Sesión de referenciaAnalítica con landing page y referrerQue el bot rastreó esa URL en el mismo momento
ConversiónAnalítica, CRM y reglas de atribuciónQue el asistente fue la única influencia

Esta separación evita interpretar crecimiento de crawl como crecimiento de demanda. Un proveedor puede actualizar un índice y generar millones de solicitudes sin enviar un solo visitante. También puede responder desde un índice de búsqueda o un socio sin que su bot haya visitado recientemente la página.

Clasificación de bots por propósito

La documentación de OpenAI distingue GPTBot, OAI-SearchBot y ChatGPT-User. Uno se relaciona con entrenamiento de modelos fundacionales, otro con la aparición de sitios en resultados de búsqueda de ChatGPT y el tercero con acciones iniciadas por usuarios. Los controles aplicables tampoco son idénticos.

Las directrices de Perplexity separan PerplexityBot, asociado a su índice de búsqueda, de Perplexity-User, que recupera páginas cuando una persona formula una solicitud. El proveedor publica archivos con rangos de IP para ayudar a verificar esas visitas.

Por eso no crearía una sola categoría llamada “AI bots”. Usaría al menos estas clases:

  • entrenamiento, cuando el proveedor declara que el bot recopila contenido para modelos
  • búsqueda e indexación, cuando mantiene un índice utilizado en respuestas
  • recuperación iniciada por usuarios, cuando la solicitud responde a una acción en el producto
  • agente automatizado, cuando navega o ejecuta una tarea en nombre de una persona
  • desconocido o no verificado, cuando solo coincide el agente de usuario.

La última categoría es necesaria. Cualquiera puede enviar un agente de usuario que diga GPTBot. Valida IP y método oficial antes de asignar el tráfico a una empresa.

Instrumentación mínima de logs

Un informe útil necesita datos sin muestreo en el borde o el origen. Guardaría el agente de usuario completo, IP, fecha con zona horaria, método, host, ruta, query string, status, bytes enviados, tiempo de respuesta y referer. Si la infraestructura usa un proxy, documentaría qué header contiene la IP del cliente y quién puede escribirlo.

El pipeline puede resolver cada solicitud contra una tabla versionada:

  1. normalizar el agente de usuario sin destruir la cadena original
  2. asignar proveedor, bot y propósito declarado
  3. validar la IP con el mecanismo oficial disponible
  4. agrupar por URL canónica, tipo de plantilla y status
  5. separar solicitudes exitosas, redirects, errores y assets
  6. conservar las reglas y rangos usados para reproducir el resultado.

Medir solo el número de hits premia patrones inútiles. Un bot puede solicitar repetidamente un asset, seguir una cadena de redirects o caer en parámetros infinitos. El cuadro de control debe mostrar URLs únicas con respuesta 200, distribución de status, bytes, frecuencia por plantilla y proporción destinada a páginas canónicas.

Métricas útiles de crawl

Empezaría con una línea base semanal y evitaría comparar proveedores solo por volumen. Sus funciones y frecuencias pueden ser diferentes.

  • cobertura útil: porcentaje de URLs canónicas importantes solicitadas por cada clase de bot
  • eficiencia: proporción de respuestas 200 frente a redirects, 404, 5xx y parámetros no canónicos
  • recencia: tiempo entre una actualización editorial y la siguiente solicitud verificada
  • profundidad: plantillas y secciones alcanzadas, no cantidad total de hits
  • costo: transferencia y tiempo de cómputo asociados a cada clase.

Una subida en cobertura puede ser buena si alcanza páginas que se quieren descubrir. La misma subida puede ser un problema si consume recursos en búsquedas internas, facetas o URLs duplicadas. La métrica necesita una lista previa de destinos válidos.

En una auditoría técnica, cruzaría esos datos con sitemap, canonical, robots y enlazado interno. Si un bot encuentra cien variantes de una ficha antes que su URL principal, el problema es arquitectura, no falta de contenido.

Instrumentos para citas y referencias

Para estudiar menciones, guarda la consulta exacta, respuesta, enlaces visibles, producto, modalidad, país, estado de sesión y fecha. Repite una muestra porque las respuestas pueden variar. Una captura aislada no establece una tasa de visibilidad.

Para referencias, crea una agrupación explícita de dominios conocidos en analítica, pero conserva el referrer original. Algunas aplicaciones no lo envían, abren navegadores internos o pasan por redirects. Por eso una categoría “Direct” puede contener visitas de asistentes que no se pueden identificar con certeza.

La conversión necesita su propio denominador. Compara sesiones, usuarios y eventos válidos por landing page. Después cruza leads o ventas con el CRM, deduplica y declara la ventana de atribución. No sumes menciones observadas a sesiones ni trates una respuesta sin clic como visita.

Regla de lectura: crawl responde “¿quién solicitó una URL?”. Las citas responden “¿quién mostró una fuente?”. La analítica responde “¿quién llegó?”. El CRM responde “¿qué resultado produjo esa visita?”.

Contexto empresarial del AI Index 2026

El capítulo económico del AI Index informa que el 88% de las organizaciones encuestadas usó IA en al menos una función empresarial durante 2025. También sitúa la adopción de IA generativa en 53% después de tres años, con diferencias por país. Son datos de encuesta y ofrecen dirección, no un censo de todas las empresas.

El mismo informe añade un límite importante. El despliegue de agentes permanece en porcentajes de un dígito en casi todas las funciones empresariales medidas. Uso de IA, uso de IA generativa y operación de agentes autónomos son etapas diferentes.

Para SEO, la lectura prudente es que hay suficiente adopción para instrumentar el canal, pero no evidencia para asumir que cada organización ya delega compras o decisiones a agentes. Tampoco permite concluir que más visitas de bots produzcan más ingresos.

Dato de StanfordInterpretación válidaExceso que conviene evitar
88% usa IA en al menos una funciónEl uso empresarial es amplio en la muestra“88% opera agentes autónomos”
53% adoptó IA generativa en tres añosLa adopción declarada avanzó rápido“53% compra mediante agentes”
Agentes en un dígito en casi todas las funcionesLa operación agéntica sigue en una fase temprana“Los agentes ya dominan el comercio”

Gobernanza para permitir o bloquear

No usaría una regla universal. Entrenamiento, búsqueda y recuperación iniciada por usuarios plantean intereses distintos. La decisión debe incluir a SEO, legal, seguridad, infraestructura y responsables del contenido.

Para cada bot documentaría:

  • propósito declarado y política aplicable
  • valor esperado, como descubrimiento o referencias medibles
  • riesgo de licencia, privacidad o exposición de contenido
  • costo técnico y patrones abusivos observados
  • directiva configurada, fecha, propietario y revisión siguiente.

Antes de cambiar robots.txt, comprueba la sintaxis admitida por cada proveedor y el alcance de la directiva. Algunos agentes iniciados por usuarios pueden comportarse de manera diferente a un crawler de fondo. Una política escrita evita que una limpieza técnica accidental se convierta en una decisión legal o comercial no aprobada.

Plan de medición para treinta días

  1. Semana 1: conserva logs completos, crea el catálogo de bots y valida IP.
  2. Semana 2: define las URLs canónicas importantes y mide cobertura, status y recencia.
  3. Semana 3: configura agrupaciones de referencia y una muestra repetible de consultas y citas.
  4. Semana 4: cruza sesiones con conversiones, calcula costos y revisa permisos con los responsables.

El resultado no debe ser un número único de “visibilidad IA”. Entregaría cuatro paneles conectados por URL y fecha: acceso de bots, menciones, sesiones y resultados. Si no hay una clave común, cualquier relación será una impresión, no un análisis.

Este enfoque también evita repetir cifras de estudios sin una fuente rastreable. Si una muestra externa no publica metodología, periodo, definición de visita y universo de sitios, no la usaría para fijar una prioridad. La evidencia del propio servidor es más estrecha, pero se puede auditar.

Para ampliar la revisión, la página sobre asistentes de IA y JavaScript explica cómo probar si una recuperación ejecuta código. La guía de Google para búsqueda con IA separa los requisitos oficiales de los archivos y optimizaciones no exigidos.

Preguntas frecuentes

¿Una visita de un bot de IA significa que mi página fue citada?

No. El log confirma una solicitud HTTP. Para probar una cita necesitas guardar la respuesta del producto, la consulta, la fecha y el enlace mostrado.

¿Cómo distingo GPTBot de OAI-SearchBot?

Usa la documentación de OpenAI, conserva el agente de usuario completo y valida las IP con el método publicado. Además, clasifica cada bot por su propósito declarado.

¿El AI Index de Stanford demuestra que los agentes ya generan ventas?

No. El informe muestra adopción empresarial amplia de IA, pero el despliegue de agentes sigue en un dígito en casi todas las funciones analizadas. No vincula visitas de bots con ventas de un sitio.

¿Debo permitir todos los bots de IA?

No existe una respuesta general. Evalúa por separado entrenamiento, búsqueda y acciones iniciadas por usuarios. Documenta valor, licencia, privacidad, costo y responsables antes de cambiar robots.txt.

Artículos relacionados

Sobre el autor

Francisco Leon de Vivero en una conferencia de SEO

Francisco Leon de Vivero

Francisco es estratega SEO senior y VP of Growth en Growing Search. Ha trabajado más de 15 años en búsqueda, incluidos siete como SEO Lead en Shopify.

Siguiente paso

Convierte esta lectura en un plan SEO más actual.

Usa la página actual más relevante si este tema sigue en tu roadmap, y revisa las pruebas y rutas de contacto si quieres apoyo directo.

Página de servicio actual

Technical SEO Advisory

El objetivo no es la comprobación de cuentas. Está traduciendo cuestiones técnicas complejas en acciones prioritarias que los equipos de desarrollo y marketing pueden ejecutar realmente.

Explorar este servicio