SEO técnico para la búsqueda con IA: la base en 2026
Ningún crawler de IA importante renderizó JavaScript (Vercel, dic 2024); en consultas con AI Overview, ser citado da +120% de clics por impresión que no serlo.
El SEO técnico es el requisito de entrada a la visibilidad en IA, no una disciplina aparte. Google afirma que no hay requisitos adicionales para aparecer en AI Overviews o AI Mode: la página debe estar indexada y ser elegible para un snippet, nada más. Mientras tanto, ningún crawler de IA importante renderiza JavaScript, así que el contenido que solo existe en cliente es invisible para ChatGPT, Claude y Perplexity. Core Web Vitals, sitemaps limpios y hreflang bidireccional siguen siendo la base sobre la que se construye todo lo demás, GEO incluido.
¿Por qué el SEO técnico es el billete de entrada a la búsqueda con IA?
Porque las funciones de IA de Google reutilizan la infraestructura clásica de Search: una página que no se puede rastrear, indexar y mostrar con snippet no puede ser citada. La propia documentación de Google es inusualmente tajante:
“There are no additional requirements to appear in AI Overviews or AI Mode.” — Google Search Central, consultado en julio de 2026
Ni archivos legibles por máquina, ni archivos de texto para IA, ni markup especial, ni un tipo de schema.org específico. Para ser elegible como enlace de apoyo en AI Overviews o AI Mode, una página debe estar indexada y ser elegible para mostrarse en Google Search con un snippet, cumpliendo los requisitos técnicos de Search (Google Search Central, consultado en julio de 2026). Los mismos controles rigen en ambos mundos: noindex, nosnippet, data-nosnippet y max-snippet gobiernan también las funciones de IA. Un noindex olvidado o un max-snippet agresivo te borra en silencio de las respuestas de IA.
De ahí salen dos consecuencias. Primera: el GEO no sustituye al SEO, ambos se solapan en la capa de infraestructura, como desgranamos en GEO vs SEO. Segunda: los datos estructurados conservan su papel en cómo las máquinas interpretan el contenido —lo tienes en nuestra guía de datos estructurados para IA—, pero Google es explícito en que no son el billete de entrada a las funciones de IA.
¿Cuáles son los umbrales oficiales de Core Web Vitals en 2026?
Los umbrales oficiales son: LCP dentro de los primeros 2,5 segundos, INP de 200 milisegundos o menos y CLS de 0,1 o menos, según web.dev (Google, consultado en julio de 2026). Una página aprueba cuando cumple cada objetivo en el percentil 75 de las cargas reales, segmentado entre móvil y escritorio.
| Métrica | Qué mide | Umbral bueno | Cómo se evalúa |
|---|---|---|---|
| LCP (Largest Contentful Paint) | Velocidad de carga del contenido principal | ≤ 2,5 s | Percentil 75, móvil y escritorio por separado |
| INP (Interaction to Next Paint) | Capacidad de respuesta a la interacción | ≤ 200 ms | Percentil 75, móvil y escritorio por separado |
| CLS (Cumulative Layout Shift) | Estabilidad visual durante la carga | ≤ 0,1 | Percentil 75, móvil y escritorio por separado |
¿Qué te compran en ranking? La posición de Google es cuidadosa: unos buenos Core Web Vitals, junto con otros aspectos de experiencia de página, se alinean con lo que sus sistemas centrales de ranking buscan premiar, pero no garantizan mejores posiciones por sí solos (Google Search Central, consultado en julio de 2026). Quien te venda un salto de posiciones garantizado por cada milisegundo ahorrado te está vendiendo humo.
¿Qué crawlers de IA conviene permitir o bloquear en robots.txt?
Permite los bots de búsqueda e indexación si quieres aparecer en respuestas de IA. Cada operador documenta user agents separados con controles independientes en robots.txt, así que entrenamiento y búsqueda son decisiones que puedes tomar una a una.
OpenAI (consultado en julio de 2026) opera GPTBot para entrenamiento de modelos, OAI-SearchBot para visibilidad en la búsqueda de ChatGPT y ChatGPT-User para visitas que inicia un usuario. OpenAI recomienda explícitamente permitir OAI-SearchBot en robots.txt para aparecer en los resultados de búsqueda de ChatGPT, y puedes bloquear GPTBot y seguir apareciendo ahí. Anthropic (consultado en julio de 2026) repite el patrón con ClaudeBot (entrenamiento), Claude-User (visitas a petición del usuario) y Claude-SearchBot (indexación para búsqueda); bloquear Claude-SearchBot puede reducir la visibilidad y la exactitud de tu sitio en las respuestas de búsqueda de Claude. Perplexity (consultado en julio de 2026) declara que PerplexityBot existe para hacer aparecer y enlazar sitios en sus resultados y no se usa para entrenar modelos fundacionales, mientras que Perplexity-User, al responder a una acción directa del usuario, generalmente ignora las reglas de robots.txt.
| Bot | Operador | Propósito | ¿Permitirlo para visibilidad en IA? |
|---|---|---|---|
| GPTBot | OpenAI | Entrenamiento de modelos | Tú decides: bloquearlo no te saca de la búsqueda de ChatGPT |
| OAI-SearchBot | OpenAI | Indexación para la búsqueda de ChatGPT | Sí — OpenAI recomienda permitirlo explícitamente |
| ChatGPT-User | OpenAI | Visitas iniciadas por el usuario | Sí, si quieres que los usuarios de ChatGPT lleguen a tus páginas |
| ClaudeBot | Anthropic | Entrenamiento de modelos | Tú decides: es un user agent distinto de Claude-SearchBot, con su propio control |
| Claude-SearchBot | Anthropic | Indexación para búsqueda | Sí — bloquearlo puede reducir la visibilidad en Claude |
| Claude-User | Anthropic | Visitas a petición del usuario | Sí |
| PerplexityBot | Perplexity | Aparecer y enlazar sitios en los resultados | Sí — no se usa para entrenar modelos fundacionales |
| Perplexity-User | Perplexity | Acciones directas del usuario | Generalmente ignora robots.txt; contrólalo a nivel de servidor si hace falta |
Para las cadenas de user agent y los detalles de verificación bot a bot, tienes nuestra guía completa de crawlers de IA.
¿Cuánto rastrean los bots de IA frente a las visitas que devuelven?
Muchísimo más de lo que devuelven, y la brecha es enorme. Según Cloudflare (datos de julio de 2025, publicados en agosto de 2025), la relación crawl-to-refer era de 38.065:1 en Anthropic, 1.091:1 en OpenAI y 194:1 en Perplexity, frente a 5,4:1 en Google. El entrenamiento impulsaba casi el 80% de la actividad de bots de IA, frente al 72% del año anterior, y la cuota de GPTBot en el tráfico de crawlers de IA subió del 4,7% al 11,7% interanual (julio de 2024 a julio de 2025). Trata estos ratios como una foto fija con fecha, no como una constante.
La dirección del movimiento cuesta ignorarla. Una recopilación de datos de Cloudflare Radar hecha por Digital Applied (junio de 2026) recoge que los bots ya generan el 57,5% del tráfico web HTML, frente al 42,5% de los humanos: es una cifra de terceros y la citamos con esa advertencia. Si las máquinas son el lector mayoritario, servirles HTML limpio y completo deja de ser opcional.
¿Los crawlers de IA renderizan JavaScript?
No, y este es el mayor punto ciego técnico de la visibilidad en IA. La última evidencia pública a gran escala es el estudio de Vercel (con MERJ) sobre tráfico real de crawlers:
“none of the major AI crawlers currently render JavaScript” — Vercel, diciembre de 2024
Eso cubre GPTBot y ChatGPT-User (OpenAI), ClaudeBot (Anthropic), PerplexityBot y los bots de Meta y ByteDance. Las excepciones que sí ejecutan JavaScript son Gemini de Google, vía la infraestructura de Googlebot, y AppleBot. La escala explica por qué importa: en un mes, en la red de Vercel, GPTBot hizo 569 millones de peticiones y ClaudeBot 370 millones; los crawlers de IA combinados llegaron a unos 1.300 millones de fetches, cerca del 28% de los 4.500 millones de Googlebot. GPTBot descarga archivos JavaScript en el 11,5% de sus peticiones y ClaudeBot en el 23,84%, pero ninguno los ejecuta. El contenido que solo aparece tras el renderizado en cliente sencillamente no existe para estos sistemas.
Googlebot sí procesa JavaScript, en tres fases —rastreo, renderizado, indexación— con una versión evergreen de Chromium, pero las páginas esperan en una cola de renderizado que puede tardar desde unos segundos hasta bastante más (Google Search Central, consultado en julio de 2026). La respuesta práctica para una pyme es la misma en ambos casos: renderizado en servidor, generación estática (Astro, Next.js, Nuxt) o prerendering, para que el contenido crítico viaje en el HTML inicial. Una advertencia honesta: el estudio de Vercel es de diciembre de 2024 y las capacidades de los crawlers pueden cambiar; sigue siendo la mejor evidencia pública disponible a mediados de 2026.
¿El sitemap XML sigue importando en la era de la IA?
Sí, y probablemente más que antes, porque los crawlers de IA navegan mal. En el mismo estudio de Vercel (diciembre de 2024), el 34,82% de los fetches de ChatGPT acabaron en un 404, frente al 8,22% de Googlebot. Un bot que malgasta un tercio de sus peticiones en URLs muertas necesita toda la ayuda que le dé un sitemap limpio.
Las reglas oficiales son más simples de lo que sugieren la mayoría de herramientas (Google Search Central, consultado en julio de 2026). Un sitemap único admite hasta 50.000 URLs o 50 MB sin comprimir; más allá, se usa un índice de sitemaps. Google ignora por completo los valores <priority> y <changefreq>, y solo usa <lastmod> cuando es consistente y verificablemente exacto respecto a la última actualización significativa de la página: tocarlo sin cambiar la página anula su sentido. Lista solo URLs canónicas y deja fuera redirecciones, parámetros y duplicados.
¿Cómo configurar canonical y hreflang sin romper un sitio multiidioma?
Elige una de las tres vías admitidas y haz que cada anotación sea recíproca. Google acepta hreflang mediante etiquetas <link> en el head, cabeceras HTTP o el sitemap XML: las tres son equivalentes (Google Search Central, consultado en julio de 2026). La regla que rompe la mayoría de implementaciones es la bidireccionalidad:
“If two pages don’t both point to each other, the tags will be ignored.” — Google Search Central, consultado en julio de 2026
Dos reglas más de la misma documentación. Especificar solo la región no es válido: el código de idioma es obligatorio. Y x-default marca la versión de respaldo que se sirve cuando ningún idioma coincide con el usuario. En un sitio como el nuestro, que publica en inglés, esloveno, español e italiano, cada versión de página debe referenciar a todas sus hermanas de forma consistente; falta un enlace de vuelta y Google descarta el par. La etiqueta canonical resuelve otro problema —consolidar duplicados dentro de un mismo idioma— mientras que hreflang conecta equivalentes entre idiomas. No uses una para parchear la otra.
¿Cuánto vale en clics una cita en una respuesta de IA?
Dentro de las consultas que activan un AI Overview, ser citado más que duplica tus clics frente a quedarte fuera. La actualización de 2026 de Seer Interactive —53 marcas, 5,47 millones de consultas y 2.430 millones de impresiones orgánicas entre enero de 2025 y febrero de 2026— encontró que ser citado en un AI Overview entrega un +120% más de clics orgánicos por impresión que no serlo.
La lectura honesta corta por los dos lados. En consultas informativas, por cada millón de impresiones, el estudio reporta unos 33.500 clics cuando no aparecía ningún AI Overview, unos 20.743 cuando el sitio era citado dentro de uno y unos 9.445 cuando no era citado. Los AI Overviews encogen el total de clics incluso para los ganadores, pero una vez que el AI Overview existe, la cita es la diferencia entre esas dos últimas cifras. Todo lo de este artículo —indexabilidad, elegibilidad para snippet, contenido renderizado en servidor, sitemaps limpios, hreflang correcto— es lo que hace esa cita técnicamente posible.
¿Qué debe arreglar tu pyme esta semana?
Pasa esta revisión de diez puntos, en orden. Casi ninguno cuesta más que atención; ninguno exige comprar una herramienta.
- Indexación y elegibilidad para snippet. En Google Search Console, confirma que tus páginas clave están indexadas y audita luego directivas sueltas de
noindex,nosnippet,data-nosnippetymax-snippet: también te sacan de AI Overviews y AI Mode. - Core Web Vitals con datos de campo. Compara el percentil 75 contra LCP ≤ 2,5 s, INP ≤ 200 ms y CLS ≤ 0,1, en móvil y escritorio por separado.
- Política de robots.txt bot a bot. Permite OAI-SearchBot, Claude-SearchBot y PerplexityBot; toma una decisión consciente sobre GPTBot y ClaudeBot, porque entrenamiento y búsqueda son controles separados.
- La prueba del JavaScript. Carga tus páginas clave con JavaScript desactivado. Si el contenido principal desaparece, ChatGPT, Claude y Perplexity no pueden leerlo.
- Arreglo del renderizado. Mueve el contenido crítico a renderizado en servidor, generación estática o prerendering, para que viaje en el HTML inicial.
- Higiene del sitemap. Solo URLs canónicas, dentro de los límites de 50.000 URLs y 50 MB,
lastmodhonesto y sinprioritynichangefreq. - Mata tus 404. Los crawlers de IA chocan con muchas más URLs muertas que Googlebot (34,82% frente a 8,22% en los datos de Vercel); arregla enlaces internos rotos y entradas caducadas del sitemap.
- Reciprocidad del hreflang. Verifica que cada par de idiomas se enlaza en los dos sentidos y que existe un x-default de respaldo.
- Códigos de idioma válidos. El idioma es obligatorio; la región sola no es válida y se ignora.
- Baseline antes de tocar nada. Registra los impactos de bots de IA en tus logs de servidor, los conteos de indexación y los Core Web Vitals, para medir cada cambio contra un antes y no contra una sensación.
Esa secuencia baseline primero —auditar, implementar, volver a medir— es como trabaja nuestro servicio de SEO técnico, y la única forma de saber si algo de esto movió la aguja.
Preguntas frecuentes
¿Necesito un markup especial o un archivo para IA para aparecer en AI Overviews o AI Mode de Google?
No. Google declara que no hay requisitos adicionales: no hacen falta archivos legibles por máquina, archivos de texto para IA, markup nuevo ni schema específico. Basta con que la página esté indexada y sea elegible para mostrarse con snippet en Google Search, cumpliendo los requisitos técnicos habituales. El mismo SEO fundamental cubre las funciones de IA.
¿Los crawlers de IA como GPTBot o ClaudeBot ejecutan JavaScript?
No. El estudio de Vercel sobre tráfico real de crawlers (diciembre 2024) encontró que ninguno de los grandes crawlers de IA de OpenAI, Anthropic, Perplexity, Meta o ByteDance renderiza JavaScript: descargan archivos JS pero nunca los ejecutan. Solo Gemini, vía la infraestructura de Googlebot, y AppleBot renderizan. Si tu contenido clave solo existe tras el renderizado en cliente, es invisible para ChatGPT, Claude y Perplexity.
¿Cuáles son los umbrales oficiales de Core Web Vitals?
Según la documentación de Google en web.dev: LCP dentro de 2,5 segundos, INP de 200 milisegundos o menos y CLS de 0,1 o menos, evaluados en el percentil 75 de las cargas reales de página y segmentados entre móvil y escritorio. Google dice que unos buenos Core Web Vitals se alinean con lo que sus sistemas de ranking buscan premiar, pero no garantizan posiciones por sí solos.
¿Debo permitir o bloquear los bots de IA en robots.txt?
Depende del bot, porque cada operador documenta propósitos distintos y controles independientes en robots.txt. Para visibilidad en respuestas de IA conviene permitir los bots de búsqueda: OAI-SearchBot (OpenAI recomienda permitirlo para aparecer en la búsqueda de ChatGPT), Claude-SearchBot (Anthropic dice que bloquearlo puede reducir tu visibilidad y exactitud en las respuestas de búsqueda de Claude) y PerplexityBot. Los bots de entrenamiento son una decisión aparte: OpenAI documenta que puedes bloquear GPTBot y seguir apareciendo en la búsqueda de ChatGPT, mientras que Anthropic lista ClaudeBot (entrenamiento) y Claude-SearchBot (indexación para búsqueda) como user agents distintos que controlas por separado.
¿El sitemap XML sigue importando en la era de la IA?
Sí, probablemente más que antes. Los crawlers de IA son ineficientes: el 34,82% de los fetches de ChatGPT acabaron en 404 en el estudio de Vercel, frente al 8,22% de Googlebot, así que un sitemap limpio con URLs canónicas les ayuda a encontrar tu contenido. Los límites oficiales son 50.000 URLs o 50 MB por archivo. Google ignora priority y changefreq, y solo usa lastmod cuando es verificablemente exacto.
¿Cómo configuro hreflang en un sitio multiidioma sin romperlo?
Elige una de las tres vías equivalentes: etiquetas link en el head, cabeceras HTTP o el sitemap XML, y haz que cada anotación sea bidireccional. Si la página X enlaza a la Y pero Y no devuelve el enlace, Google ignora las etiquetas. Usa códigos de idioma válidos, porque la región sola no es válida, y añade x-default como versión de respaldo cuando ningún idioma coincide.