← Todos los artículos

Crawlers de IA: GPTBot, ClaudeBot y robots.txt en 2026

Qué hace cada bot: GPTBot, OAI-SearchBot, ClaudeBot y PerplexityBot. Ninguno ejecuta JavaScript. Cómo configurar tu robots.txt bot a bot, sin perder citas.

Los crawlers de IA son los bots automáticos que OpenAI, Anthropic, Perplexity, Google y Microsoft envían a leer tu web para tres trabajos distintos: entrenar modelos, construir índices de búsqueda y visitar páginas en vivo cuando alguien pregunta. Cada bot obedece su propio token de robots.txt, así que bloquear el equivocado puede sacarte en silencio de las respuestas de IA. Y según las pruebas que Vercel hizo con Merj en diciembre de 2024, ninguno de los grandes ejecuta JavaScript: lo que tu servidor envía como HTML es lo que ven.

¿Por qué le importan los crawlers de IA a tu visibilidad?

Porque ser rastreado es el billete de entrada: si un bot de búsqueda de IA nunca lee tu página, ChatGPT, Claude o Perplexity no pueden citarla. Según Cloudflare (julio de 2025), el tráfico combinado de crawlers de IA y de búsqueda creció un 18% entre mayo de 2024 y mayo de 2025. La cuota de GPTBot en ese tráfico saltó del 2,2% al 7,7% —un aumento del 305%—, mientras Googlebot subía del 30% al 50%, ClaudeBot caía del 11,7% al 5,4% y Bingbot se situaba en torno al 8,7%.

La mayoría de los dueños de sitios no ha reaccionado. En el mismo estudio, solo el 14% de los 3.816 dominios top analizados tenía directivas de robots.txt específicas para bots de IA, y GPTBot era el bot más bloqueado (312 dominios). Ser rastreado es el paso uno; convertir rastreos en citas es otro problema, que desmenuzamos en cómo eligen los motores de IA a quién citar.

¿Cuáles son los tres tipos de bot de IA?

Todo crawler de IA documentado hace uno de estos tres trabajos: entrenar modelos, indexar para búsqueda o hacer fetch en vivo por petición de un usuario. La distinción importa porque cada tipo tiene un intercambio distinto, y robots.txt te deja tratarlos por separado.

Según Cloudflare (agosto de 2025), el entrenamiento de modelos supone alrededor del 79-80% de la actividad de bots de IA (subió desde el 72% de julio de 2024), la búsqueda el 17% y las acciones de usuario el 3,2%. La categoría de acciones de usuario es la que más crece: el Radar 2025 Year in Review de Cloudflare midió que el fetch disparado por usuarios creció más de 15 veces durante 2025, con ChatGPT-User marcando picos de hasta 16 veces su nivel de principios de año.

Esta es la lista completa de bots documentados y lo que hace realmente bloquear a cada uno:

BotOperadorTrabajoSi lo bloqueas en robots.txtEjecuta JS
GPTBotOpenAIEntrenamiento de modelosContenido excluido de los datasets de entrenamiento de OpenAINo
OAI-SearchBotOpenAIÍndice de búsqueda de ChatGPTTu sitio ya no puede aparecer en los resultados de búsqueda de ChatGPTNo
ChatGPT-UserOpenAIFetch en vivo por petición del usuarioPuede no aplicar: las visitas las inicia el usuarioNo
OAI-AdsBotOpenAIValida landing pages de anunciosSin probar
ClaudeBotAnthropicEntrenamiento de modelosMaterial futuro excluido de los datasets de entrenamiento de ClaudeNo
Claude-SearchBotAnthropicÍndice de búsqueda de ClaudeMenos visibilidad en los resultados de búsqueda de ClaudeSin probar
Claude-UserAnthropicFetch en vivo por petición del usuarioClaude ya no puede traer tus páginas durante las conversaciones con usuariosSin probar
PerplexityBotPerplexityÍndice de búsqueda (no entrenamiento)Ya no pueden mostrarte ni enlazarte en los resultados de PerplexityNo
Perplexity-UserPerplexityFetch en vivo por petición del usuarioGeneralmente ignorado, según la propia documentación de PerplexitySin probar
Google-ExtendedGoogleToken que controla el entrenamiento y el grounding de GeminiSin entrenamiento ni grounding de Gemini; Google Search no se ve afectadon/a
BingbotMicrosoftÍndice de Bing; según se informa, alimenta también las respuestas de Copilot *Sales de Bing y, según se informa, de Copilot a la vez *Sin probar

Los propósitos salen de la documentación oficial de cada proveedor (2026), salvo la fila de Bingbot (*): su vínculo con Copilot nos llega de la documentación de Bing Webmaster Tools vía fuentes secundarias —no hemos podido abrir la página primaria—, así que trátalo como reportado, no como verificado. La columna de JavaScript refleja las pruebas de Vercel de finales de 2024, con los bots no probados marcados como tal.

¿Qué crawlers tiene OpenAI y qué controla cada uno?

OpenAI documenta cuatro crawlers, cada uno con su propio token de robots.txt, su user-agent y sus rangos de IP publicados, según la documentación de crawlers de OpenAI (2026):

  1. GPTBot (user-agent GPTBot/1.4, IPs publicadas en openai.com/gptbot.json) recopila contenido para entrenar modelos. Ponerle Disallow excluye tu sitio de los datasets de entrenamiento de OpenAI.
  2. OAI-SearchBot (OAI-SearchBot/1.4) alimenta la búsqueda dentro de ChatGPT. Permitirlo es lo que hace que tu sitio pueda aparecer en los resultados de búsqueda de ChatGPT, y OpenAI advierte que puede tardar unas 24 horas en procesar los cambios de robots.txt.
  3. ChatGPT-User (ChatGPT-User/1.0) visita páginas durante las conversaciones. Como cada visita la inicia una persona, OpenAI señala que robots.txt puede no aplicarle.
  4. OAI-AdsBot valida las landing pages de anuncios.

Los ajustes son independientes entre bots. La consecuencia práctica: puedes rechazar el entrenamiento de OpenAI y conservar toda tu visibilidad en la búsqueda de ChatGPT. Son palancas separadas.

¿Qué hacen ClaudeBot, Claude-SearchBot y Claude-User?

Anthropic documenta tres crawlers, y todos respetan robots.txt, según el centro de ayuda de Claude (2026). ClaudeBot recopila contenido web que puede usarse para entrenar los modelos Claude y soporta la directiva Crawl-delay. Claude-SearchBot indexa páginas para mejorar la calidad de los resultados de búsqueda de Claude. Claude-User accede a una página cuando la pregunta de un usuario a Claude lo requiere.

Bloquear cada bot tiene un efecto distinto y necesita su propia entrada en robots.txt. Anthropic afirma que, una vez que ClaudeBot está bloqueado, el material futuro debería quedar excluido de sus datasets de entrenamiento. Los rangos de IP están publicados en claude.com/crawling/bots.json, así que puedes verificar que el tráfico que dice ser de Claude lo es de verdad.

¿Respeta Perplexity el robots.txt?

Su crawler declarado sí; su agente de usuario no tiene por qué. Según la documentación de crawlers de Perplexity (2026), PerplexityBot (PerplexityBot/1.0, IPs en perplexity.com/perplexitybot.json) indexa páginas para mostrar y enlazar sitios en los resultados —no para entrenar modelos— y respeta robots.txt. Perplexity-User gestiona las visitas iniciadas por usuarios y, en palabras de la propia Perplexity, “generally ignores robots.txt rules” porque cada petición la origina una persona.

También hay un problema de credibilidad documentado. El 4 de agosto de 2025, Cloudflare acusó a Perplexity de crawling sigiloso: un user-agent genérico de Chrome, no declarado, generando de 3 a 6 millones de peticiones diarias además de los 20-25 millones del crawler declarado, rotando IPs y ASNs para evadir bloqueos e ignorando robots.txt en dominios de prueba. Cloudflare lo retiró de su lista de bots verificados. La lección se generaliza: robots.txt es una petición de cortesía, no una barrera técnica.

¿Es Google-Extended un crawler? ¿Y Bingbot alimenta a Copilot?

Google-Extended no es un crawler en absoluto. Es un token de producto de robots.txt independiente, sin user-agent propio: el rastreo lo hacen los user-agents que Google ya tiene. El token controla si tu contenido puede usarse para entrenar futuros modelos Gemini (Gemini Apps y Vertex AI) y para grounding, según la documentación de crawlers de Google (2026):

“Google-Extended does not impact a site’s inclusion in Google Search nor is it used as a ranking signal.” — Google for Developers, 2026

Los dueños de sitios se han dado cuenta de lo barato que sale ese intercambio: el Radar 2025 Year in Review de Cloudflare encontró que las directivas allow para Google-Extended se triplicaron durante 2025, justo mientras GPTBot, ClaudeBot y CCBot encabezaban la lista de bots bloqueados por completo con más frecuencia.

Bingbot es el caso contrario, con una advertencia sobre nuestra propia evidencia. Según recoge la documentación de Bing Webmaster Tools —una página que no hemos podido abrir directamente para verificarla—, el mismo rastreo de Bingbot alimenta el índice de Bing Search y las respuestas de IA de Microsoft Copilot, y Microsoft publica IPs validadas en bingbot.json y recomienda la verificación por DNS. Lo marcamos como reportado, no como confirmado. Lo que sí está documentado de primera mano es el user-agent oficial —una cadena tipo Chrome que contiene bingbot/2.0, con variante móvil—, anunciado por Microsoft el 28 de abril de 2022. Si el relato del rastreo compartido se sostiene, entonces, a diferencia de OpenAI o Anthropic, aquí no hay palanca separada: la visibilidad en Bing y la exposición en Copilot vienen en el mismo paquete.

¿Cuánto rastrean los bots de IA y cuánto tráfico devuelven?

Rastrean mucho y refieren poco. A finales de 2024, Vercel midió los volúmenes mensuales en su red: GPTBot hizo 569 millones de peticiones, Claude de Anthropic 370 millones, AppleBot 314 millones y PerplexityBot 24,4 millones. En conjunto, cerca del 20% de los 4.500 millones de Googlebot en el mismo periodo.

El mismo estudio encontró crawlers de IA llamativamente ineficientes: ChatGPT gastó el 34,82% de sus fetches en páginas 404 y Claude el 34,16%, frente al 8,22% de Googlebot. ChatGPT prioriza el HTML (57,70% de los fetches), mientras Claude se inclina por las imágenes (35,17%).

El tráfico de referencia es la parte que enfría los ánimos. Los ratios crawl-to-refer de Cloudflare —páginas rastreadas por cada visita humana referida— salen de dos posts distintos que miden cortes distintos, así que cada columna va etiquetada con el suyo:

OperadorTodos los sitios — Cloudflare, 29 ago. 2025 (ventana de jul. 2025)Medios de noticias — Cloudflare, 28 ago. 2025
Anthropic38.066:12.500:1
OpenAI1.091:1152:1
Perplexity195:132,7:1
Google5,4:1

“…still crawled 38,000 pages for every referred page visit in July 2025.” — Cloudflare sobre Anthropic, 29 de agosto de 2025

Según el desglose por sector de Cloudflare (agosto de 2025), ClaudeBot y GPTBot suman juntos casi la mitad del crawling de IA observado, y en el sector de noticias ChatGPT-User alcanza el 14,9% del crawling: señal de una demanda intensa de usuarios reales. La lectura estratégica para una pyme: la visibilidad en IA hoy paga en citas y presencia de marca, no en clics masivos.

¿Renderizan JavaScript los crawlers de IA?

No. Ninguno de los grandes crawlers de IA ejecuta JavaScript. Un estudio de Vercel con Merj (diciembre de 2024) los probó directamente:

“ChatGPT and Claude don’t execute JavaScript.” — Vercel, diciembre de 2024

Ni GPTBot, ni OAI-SearchBot, ni ChatGPT-User, ni ClaudeBot, ni PerplexityBot, ni Meta-ExternalAgent, ni Bytespider, ni CCBot renderizaron JS. Solo lo hicieron Gemini —vía la infraestructura de Googlebot— y AppleBot. Los bots sí descargan archivos JavaScript (el 11,50% de los fetches de ChatGPT y el 23,84% de los de Claude); simplemente nunca los ejecutan.

La implicación es contundente: si tus precios, descripciones de producto o FAQ se inyectan en el cliente, son invisibles para los asistentes de IA. El contenido crítico tiene que llegar en la respuesta HTML del servidor, mediante renderizado en servidor o generación estática. Es la misma disciplina que premia la búsqueda clásica —lo vemos en los fundamentos de SEO técnico— y es lo primero que revisamos en una auditoría de SEO técnico.

¿Cómo configurar robots.txt para los bots de IA?

Bot a bot, línea a línea: no existe un interruptor único de IA. Poner Disallow a GPTBot bloquea solo el crawler de entrenamiento de OpenAI y deja OAI-SearchBot intacto; bloquear ClaudeBot no afecta a Claude-SearchBot ni a Claude-User. Tanto OpenAI como Anthropic advierten que bloquear sus bots de búsqueda reduce tu visibilidad y tu citación en sus respuestas.

Un punto de partida sensato para la mayoría de las pymes: permite los bots de búsqueda y de usuario, y luego toma una decisión deliberada sobre los de entrenamiento.

# Opción A — por defecto: permitirlo todo (no hacen falta entradas de IA)

# Opción B — bloquear el entrenamiento, mantener la visibilidad en búsqueda de IA
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

# Opción C — limitar el entrenamiento en lugar de bloquearlo
# (Anthropic documenta soporte de Crawl-delay para ClaudeBot)
User-agent: ClaudeBot
Crawl-delay: 1

Dos detalles operativos. Primero, OAI-SearchBot puede tardar unas 24 horas en procesar los cambios de robots.txt, según la documentación de OpenAI. Segundo, cada proveedor publica listas de IP (openai.com/gptbot.json, claude.com/crawling/bots.json, perplexity.com/perplexitybot.json) para que verifiques si un visitante que dice ser un bot lo es de verdad. Ten en cuenta además que robots.txt regula quién puede rastrear, mientras que el archivo llms.txt propone qué deberían leer primero los sistemas de IA: lo explicamos en nuestra guía de llms.txt.

¿Qué hacer esta semana?

Una checklist práctica para un equipo pequeño:

  1. Saca los logs de tu servidor y busca GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-SearchBot, Claude-User, PerplexityBot y bingbot. Primero el baseline, después las opiniones.
  2. Audita tu robots.txt contra la tabla de arriba. Confirma que ningún bot de búsqueda o de usuario está bloqueado por accidente: recuerda que solo el 14% de los dominios top tenía alguna directiva específica de IA (Cloudflare, julio de 2025).
  3. Decide tu postura sobre el entrenamiento. Bloquear GPTBot y ClaudeBot no cuesta visibilidad en la búsqueda de IA: OpenAI y Anthropic mantienen la búsqueda en palancas separadas. Google-Extended es otro intercambio: Google afirma que no afecta la inclusión ni el ranking en Google Search, pero el mismo token también apaga el grounding, así que es el único bloqueo de entrenamiento que lleva un coste de visibilidad en IA asociado.
  4. Prueba una página clave con JavaScript desactivado o tráela con curl. Si el contenido principal no está en el HTML crudo, los crawlers de IA no pueden verlo.
  5. Revisa los logs otra vez a las 24-48 horas, porque OpenAI dice que OAI-SearchBot puede tardar alrededor de 24 horas en procesar los cambios de robots.txt.

Esa secuencia —baseline, implementar, medir antes y después— es exactamente la que aplicamos en nuestro servicio de visibilidad en IA, con cada número publicado etiquetado como medido, calculado o supuesto.

Preguntas frecuentes

Si bloqueo GPTBot en robots.txt, ¿desaparezco de ChatGPT?

No. GPTBot solo recopila contenido para entrenar modelos; la búsqueda de ChatGPT la alimenta OAI-SearchBot, un bot distinto con su propio ajuste independiente. Puedes bloquear GPTBot (entrenamiento) y seguir apareciendo citado en ChatGPT si permites OAI-SearchBot. OpenAI indica que los cambios en robots.txt pueden tardar alrededor de 24 horas en procesarse para la búsqueda.

¿Los crawlers de IA ven el contenido que cargo con JavaScript?

No. Según el estudio de Vercel y Merj de diciembre de 2024, ni GPTBot, ni OAI-SearchBot, ni ClaudeBot, ni PerplexityBot ejecutan JavaScript: solo leen el HTML que devuelve el servidor y descargan los archivos JS sin ejecutarlos. Solo Gemini, vía la infraestructura de Googlebot, y AppleBot renderizan JS. Si tu contenido clave depende de JavaScript en el cliente, es invisible para los asistentes de IA.

¿Bloquear Google-Extended me saca de Google?

No. Google-Extended no es un crawler: es un token de robots.txt que controla si tu contenido puede usarse para entrenar modelos Gemini y para grounding. Google afirma explícitamente que no afecta la inclusión ni el ranking en Google Search. El rastreo lo siguen haciendo los user-agents normales de Google.

¿Cuál es la diferencia entre bots de entrenamiento, de búsqueda y de usuario?

Los de entrenamiento, como GPTBot y ClaudeBot, recopilan contenido para entrenar modelos y suponen alrededor del 80 por ciento del crawling de IA según Cloudflare. Los de búsqueda, como OAI-SearchBot, Claude-SearchBot y PerplexityBot, indexan páginas para que los motores puedan citarte, y bloquearlos reduce tu visibilidad en IA. Los de usuario, como ChatGPT-User, visitan tu página en vivo cuando una persona lo pide; esta categoría creció más de 15 veces en 2025 según Cloudflare Radar.

¿Cuánto tráfico real devuelven los bots de IA a mi web?

Poco, y varía mucho según el sector. Cloudflare, midiendo su propia red, publicó los ratios crawl-to-refer —páginas rastreadas por cada visita humana referida— de una ventana de julio de 2025 en su post del 29 de agosto de 2025: Anthropic rastreaba unas 38.000 páginas por cada visita referida, OpenAI unas 1.100, Perplexity unas 195 y Google 5,4. En otro post distinto de Cloudflare, el del 28 de agosto de 2025, centrado en medios de noticias, los ratios son mucho mejores: 152:1 en OpenAI y 32,7:1 en Perplexity. La apuesta GEO se sostiene en visibilidad y citación más que en volumen de clics.

¿Todos los bots de IA respetan robots.txt?

Los crawlers declarados de OpenAI, Anthropic y Perplexity dicen respetarlo, y Anthropic acepta además Crawl-delay. Hay excepciones documentadas: Perplexity-User generalmente ignora robots.txt por diseño, al ser una petición iniciada por el usuario, y Cloudflare documentó en agosto de 2025 crawling sigiloso de Perplexity con user-agents no declarados e IPs rotativas. Trata robots.txt como una petición de cortesía, no como una barrera técnica.


Dinos hasta dónde quieres llegar. Te diremos, con claridad, cómo lo conseguiríamos.

Hablemos