El benchmark de Ahrefs para búsqueda con IA, leído sin atajos
Qué miden realmente los estudios de Ahrefs sobre AI Overviews, AI Mode y citas, qué límites tienen y cómo convertirlos en un tablero útil para SEO.
Los datos de Ahrefs permiten medir por separado el ranking, la presencia en respuestas y el tráfico referido, sin probar una fórmula universal para conseguir citas ni que Google haya dejado de importar.
La lectura útil consiste en conservar el SEO técnico y editorial que permite descubrir una página, añadir medición de citas y menciones, y comprobar si esa visibilidad produce visitas o negocio. Cada cifra necesita su muestra al lado.
Video de SEOFrancisco
Cómo leer los benchmarks de búsqueda con IA
Francisco explica qué cambia en la medición y dónde terminan las conclusiones de los estudios.
Primero hay que separar los estudios
Ahrefs publicó cuatro análisis con preguntas, fechas y universos distintos, mientras que la página anterior reunió sus resultados bajo una sola conclusión y omitió esas diferencias. La tabla conserva el alcance de cada muestra.
| Pregunta | Muestra de Ahrefs | Conclusión defendible |
|---|---|---|
| ¿AI Mode y AI Overviews usan las mismas fuentes? | 540.000 pares de consultas para el análisis de citas y URL, y 730.000 pares de consultas para la similitud de contenido, en Estados Unidos durante septiembre de 2025 | Las respuestas pueden parecer similares aunque las citas concretas cambien mucho. |
| ¿Una mención de marca incluye un enlace? | 31.000 menciones de Ahrefs dentro de una base de 150 millones de prompts | En el caso de Ahrefs, la mayoría de las menciones analizadas no llevaba enlace. |
| ¿ChatGPT ya compite con Google por volumen referido? | Datos de Web Analytics en 76.000 sitios | Google envió 190 veces más tráfico que ChatGPT en esa red y periodo. |
| ¿Toda página muy citada también posiciona? | Las 1.000 páginas más citadas en ChatGPT durante septiembre de 2025 | El 28,3% no tenía visibilidad orgánica de palabras clave en Ahrefs. |
Las fuentes primarias permiten revisar el detalle: el estudio de AI Overviews frente a AI Mode, el análisis de menciones y enlaces de Ahrefs, la comparación de tráfico de Google y ChatGPT y la muestra de páginas más citadas por ChatGPT.
Los cuatro trabajos ayudan a formular hipótesis. Ninguno autoriza a extrapolar su porcentaje a cualquier sector, país o herramienta. La muestra de 31.000 menciones pertenece a una sola marca. La de las 1.000 páginas más citadas se concentra en el extremo superior de la distribución. El panel de 76.000 sitios depende de quienes usan el producto de analítica de Ahrefs.
Ranking, citación y tráfico son mediciones distintas
Uso tres columnas al revisar una cuenta porque cada una responde a una pregunta diferente:
- Descubrimiento orgánico. ¿La página puede rastrearse, indexarse y aparecer para consultas relevantes?
- Presencia en respuestas. ¿La marca o la URL aparece en un conjunto estable de prompts y plataformas?
- Resultado posterior. ¿Esa presencia genera una visita, una búsqueda de marca, un lead o una venta?
El 28,3% de páginas sin visibilidad orgánica en la muestra de ChatGPT confirma que el ranking y la citación pueden divergir. La muestra también atribuye visibilidad al 71,7% restante, de modo que el dato no vuelve prescindible al SEO. El estudio no identifica por sí solo qué variable causó la selección de cada fuente.
El contraste entre AI Mode y AI Overviews deja otra lección. Ahrefs encontró solo un 13,7% de coincidencia entre las URL citadas, pero una similitud semántica del 86% entre respuestas. Dos sistemas pueden construir una contestación parecida con documentos distintos. Por eso una auditoría de SEO para búsqueda con IA necesita guardar fuente, plataforma, fecha, prompt y modo de ejecución.
Una mención no garantiza un clic
En la muestra de la propia marca Ahrefs, el porcentaje de menciones con enlace fue del 10,7% en AI Overviews, 16,8% en Gemini, 26,1% en Copilot, 26,9% en ChatGPT, 36,8% en AI Mode y 51,6% en Perplexity, con un promedio de 28%. Este caso sirve para diseñar el reporte dentro de esa base de prompts, sin convertir el promedio en una tasa de enlace para toda la web. Una mención sin enlace puede tener valor de marca, pero no debe sumarse a tráfico ni a conversiones.
Regla de reporte. Guarda menciones, citas enlazadas, sesiones referidas y conversiones en campos separados. Si los juntas bajo “visibilidad IA”, no sabrás qué mejoró.
Aplicación del benchmark a un sitio real
Después de más de quince años trabajando en SEO, incluidos siete como SEO Lead en Shopify y más de cuatro en Pornhub, aprendí a desconfiar de los promedios que llegan sin denominador. En una migración o una caída de tráfico, la tendencia general de la búsqueda con IA importa menos que identificar qué consultas, páginas y mercados cambiaron dentro del sitio que estoy revisando.
Para una prueba de seis semanas usaría este protocolo:
- Elegir entre 25 y 50 prompts ligados a decisiones reales del cliente, no variaciones creadas para inflar la muestra.
- Registrar semanalmente plataforma, modelo o modo visible, país, respuesta, dominios citados y presencia de enlace.
- Conservar en GSC un grupo comparable de consultas y páginas para medir impresiones, clics y posición.
- Etiquetar referencias de ChatGPT, Perplexity, Gemini y otros asistentes en analítica, sin asumir que todo el tráfico llega con un referrer limpio.
- Anotar cambios editoriales y técnicos por URL para evitar atribuir una variación a varias intervenciones simultáneas.
La revisión semanal detecta volatilidad. La evaluación de seis semanas reduce la tentación de celebrar una sola respuesta. Si el proyecto también tiene problemas de indexación, empiezo por la base técnica. Un experimento de citas no compensa canonicales rotos, contenido duplicado o páginas que Google no puede procesar.
Decisiones editoriales a partir del benchmark
Aunque los estudios no entregan una receta de redacción, de sus resultados extraigo tres controles editoriales:
- Afirmaciones rastreables. Cada cifra importante debe llevar a la fuente que explica muestra, fecha y método.
- Experiencia que no puede copiarse. Capturas propias, decisiones, resultados con contexto y límites aportan algo que un resumen de terceros no ofrece.
- Bloques comprensibles. Una definición, tabla o procedimiento debe funcionar dentro de la página sin depender de una introducción llena de relleno.
También eliminaría páginas que repiten el mismo argumento con palabras distintas. La guía oficial de Google para funciones generativas recomienda contenido valioso y no comoditizado. También advierte que crear variaciones de consulta para manipular rankings o respuestas generativas infringe su política contra el abuso de contenido a gran escala. Esa recomendación coincide con el trabajo de reducción de inventario que estamos aplicando en SEOFrancisco.
El objetivo del benchmark es mejorar decisiones, no producir otro número para una presentación. Si una página gana citas pero pierde sus consultas comerciales, hay que investigar. Si gana impresiones y menciones pero ninguna acción posterior, el mensaje o la medición siguen incompletos.
Preguntas frecuentes
¿Ahrefs publicó un único informe con todas estas cifras?
Las cifras provienen de estudios diferentes. Cada página explica una muestra y una fecha propias, por lo que no deben combinarse como si fueran un solo experimento.
¿El 28,3% prueba que las citas no dependen del SEO?
El 28,3% indica que algunas páginas muy citadas no tenían visibilidad orgánica registrada por Ahrefs. El estudio no aísla causalidad ni vuelve irrelevante la indexación, la autoridad o la calidad de la fuente.
¿Una mención sin enlace tiene valor?
Puede tenerlo para recuerdo de marca o consideración, pero no equivale a una sesión. Repórtala como mención y mide por separado enlaces, visitas y conversiones.
¿Cuántos prompts necesito para empezar?
Para empezar, un conjunto estable de 25 a 50 prompts comerciales aporta más información que cientos de variaciones sin demanda comprobada. Documenta país, plataforma, fecha y respuesta.
