---
title: "Crawlers de IA: GPTBot, ClaudeBot y robots.txt en 2026"
description: "Qué hace cada bot: GPTBot, OAI-SearchBot, ClaudeBot y PerplexityBot. Ninguno ejecuta JavaScript. Cómo configurar tu robots.txt bot a bot, sin perder citas."
lang: es
canonical: https://upgradepro.eu/es/blog/ai-crawlers-guide
published: 2026-07-16
tags: ["GEO", "técnico"]
---

# Crawlers de IA: GPTBot, ClaudeBot y robots.txt en 2026

> Qué hace cada bot: GPTBot, OAI-SearchBot, ClaudeBot y PerplexityBot. Ninguno ejecuta JavaScript. Cómo configurar tu robots.txt bot a bot, sin perder citas.

Los crawlers de IA son los bots automáticos que OpenAI, Anthropic, Perplexity, Google y Microsoft envían a leer tu web para tres trabajos distintos: entrenar modelos, construir índices de búsqueda y visitar páginas en vivo cuando alguien pregunta. Cada bot obedece su propio token de robots.txt, así que bloquear el equivocado puede sacarte en silencio de las respuestas de IA. Y según las pruebas que Vercel hizo con Merj en diciembre de 2024, ninguno de los grandes ejecuta JavaScript: lo que tu servidor envía como HTML es lo que ven.

## ¿Por qué le importan los crawlers de IA a tu visibilidad?

Porque ser rastreado es el billete de entrada: si un bot de búsqueda de IA nunca lee tu página, ChatGPT, Claude o Perplexity no pueden citarla. Según [Cloudflare](https://blog.cloudflare.com/from-googlebot-to-gptbot-whos-crawling-your-site-in-2025/) (julio de 2025), el tráfico combinado de crawlers de IA y de búsqueda creció un 18% entre mayo de 2024 y mayo de 2025. La cuota de GPTBot en ese tráfico saltó del 2,2% al 7,7% —un aumento del 305%—, mientras Googlebot subía del 30% al 50%, ClaudeBot caía del 11,7% al 5,4% y Bingbot se situaba en torno al 8,7%.

La mayoría de los dueños de sitios no ha reaccionado. En el mismo estudio, solo el 14% de los 3.816 dominios top analizados tenía directivas de robots.txt específicas para bots de IA, y GPTBot era el bot más bloqueado (312 dominios). Ser rastreado es el paso uno; convertir rastreos en citas es otro problema, que desmenuzamos en [cómo eligen los motores de IA a quién citar](/es/blog/how-ai-engines-cite).

## ¿Cuáles son los tres tipos de bot de IA?

Todo crawler de IA documentado hace uno de estos tres trabajos: entrenar modelos, indexar para búsqueda o hacer fetch en vivo por petición de un usuario. La distinción importa porque cada tipo tiene un intercambio distinto, y robots.txt te deja tratarlos por separado.

Según [Cloudflare](https://blog.cloudflare.com/crawlers-click-ai-bots-training/) (agosto de 2025), el entrenamiento de modelos supone alrededor del 79-80% de la actividad de bots de IA (subió desde el 72% de julio de 2024), la búsqueda el 17% y las acciones de usuario el 3,2%. La categoría de acciones de usuario es la que más crece: el [Radar 2025 Year in Review](https://blog.cloudflare.com/radar-2025-year-in-review/) de Cloudflare midió que el fetch disparado por usuarios creció más de 15 veces durante 2025, con ChatGPT-User marcando picos de hasta 16 veces su nivel de principios de año.

Esta es la lista completa de bots documentados y lo que hace realmente bloquear a cada uno:

| Bot | Operador | Trabajo | Si lo bloqueas en robots.txt | Ejecuta JS |
|---|---|---|---|---|
| GPTBot | OpenAI | Entrenamiento de modelos | Contenido excluido de los datasets de entrenamiento de OpenAI | No |
| OAI-SearchBot | OpenAI | Índice de búsqueda de ChatGPT | Tu sitio ya no puede aparecer en los resultados de búsqueda de ChatGPT | No |
| ChatGPT-User | OpenAI | Fetch en vivo por petición del usuario | Puede no aplicar: las visitas las inicia el usuario | No |
| OAI-AdsBot | OpenAI | Valida landing pages de anuncios | — | Sin probar |
| ClaudeBot | Anthropic | Entrenamiento de modelos | Material futuro excluido de los datasets de entrenamiento de Claude | No |
| Claude-SearchBot | Anthropic | Índice de búsqueda de Claude | Menos visibilidad en los resultados de búsqueda de Claude | Sin probar |
| Claude-User | Anthropic | Fetch en vivo por petición del usuario | Claude ya no puede traer tus páginas durante las conversaciones con usuarios | Sin probar |
| PerplexityBot | Perplexity | Índice de búsqueda (no entrenamiento) | Ya no pueden mostrarte ni enlazarte en los resultados de Perplexity | No |
| Perplexity-User | Perplexity | Fetch en vivo por petición del usuario | Generalmente ignorado, según la propia documentación de Perplexity | Sin probar |
| Google-Extended | Google | Token que controla el entrenamiento y el grounding de Gemini | Sin entrenamiento ni grounding de Gemini; Google Search no se ve afectado | n/a |
| Bingbot | Microsoft | Índice de Bing; según se informa, alimenta también las respuestas de Copilot * | Sales de Bing y, según se informa, de Copilot a la vez * | Sin probar |

Los propósitos salen de la documentación oficial de cada proveedor (2026), salvo la fila de Bingbot (*): su vínculo con Copilot nos llega de la documentación de Bing Webmaster Tools vía fuentes secundarias —no hemos podido abrir la página primaria—, así que trátalo como reportado, no como verificado. La columna de JavaScript refleja las pruebas de Vercel de finales de 2024, con los bots no probados marcados como tal.

## ¿Qué crawlers tiene OpenAI y qué controla cada uno?

OpenAI documenta cuatro crawlers, cada uno con su propio token de robots.txt, su user-agent y sus rangos de IP publicados, según la [documentación de crawlers de OpenAI](https://developers.openai.com/api/docs/bots) (2026):

1. **GPTBot** (user-agent GPTBot/1.4, IPs publicadas en openai.com/gptbot.json) recopila contenido para entrenar modelos. Ponerle Disallow excluye tu sitio de los datasets de entrenamiento de OpenAI.
2. **OAI-SearchBot** (OAI-SearchBot/1.4) alimenta la búsqueda dentro de ChatGPT. Permitirlo es lo que hace que tu sitio pueda aparecer en los resultados de búsqueda de ChatGPT, y OpenAI advierte que puede tardar unas 24 horas en procesar los cambios de robots.txt.
3. **ChatGPT-User** (ChatGPT-User/1.0) visita páginas durante las conversaciones. Como cada visita la inicia una persona, OpenAI señala que robots.txt puede no aplicarle.
4. **OAI-AdsBot** valida las landing pages de anuncios.

Los ajustes son independientes entre bots. La consecuencia práctica: puedes rechazar el entrenamiento de OpenAI y conservar toda tu visibilidad en la búsqueda de ChatGPT. Son palancas separadas.

## ¿Qué hacen ClaudeBot, Claude-SearchBot y Claude-User?

Anthropic documenta tres crawlers, y todos respetan robots.txt, según el [centro de ayuda de Claude](https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler) (2026). ClaudeBot recopila contenido web que puede usarse para entrenar los modelos Claude y soporta la directiva Crawl-delay. Claude-SearchBot indexa páginas para mejorar la calidad de los resultados de búsqueda de Claude. Claude-User accede a una página cuando la pregunta de un usuario a Claude lo requiere.

Bloquear cada bot tiene un efecto distinto y necesita su propia entrada en robots.txt. Anthropic afirma que, una vez que ClaudeBot está bloqueado, el material futuro debería quedar excluido de sus datasets de entrenamiento. Los rangos de IP están publicados en claude.com/crawling/bots.json, así que puedes verificar que el tráfico que dice ser de Claude lo es de verdad.

## ¿Respeta Perplexity el robots.txt?

Su crawler declarado sí; su agente de usuario no tiene por qué. Según la [documentación de crawlers de Perplexity](https://docs.perplexity.ai/guides/bots) (2026), PerplexityBot (PerplexityBot/1.0, IPs en perplexity.com/perplexitybot.json) indexa páginas para mostrar y enlazar sitios en los resultados —no para entrenar modelos— y respeta robots.txt. Perplexity-User gestiona las visitas iniciadas por usuarios y, en palabras de la propia Perplexity, "generally ignores robots.txt rules" porque cada petición la origina una persona.

También hay un problema de credibilidad documentado. El 4 de agosto de 2025, [Cloudflare](https://blog.cloudflare.com/perplexity-is-using-stealth-undeclared-crawlers-to-evade-website-no-crawl-directives/) acusó a Perplexity de crawling sigiloso: un user-agent genérico de Chrome, no declarado, generando de 3 a 6 millones de peticiones diarias además de los 20-25 millones del crawler declarado, rotando IPs y ASNs para evadir bloqueos e ignorando robots.txt en dominios de prueba. Cloudflare lo retiró de su lista de bots verificados. La lección se generaliza: robots.txt es una petición de cortesía, no una barrera técnica.

## ¿Es Google-Extended un crawler? ¿Y Bingbot alimenta a Copilot?

Google-Extended no es un crawler en absoluto. Es un token de producto de robots.txt independiente, sin user-agent propio: el rastreo lo hacen los user-agents que Google ya tiene. El token controla si tu contenido puede usarse para entrenar futuros modelos Gemini (Gemini Apps y Vertex AI) y para grounding, según la [documentación de crawlers de Google](https://developers.google.com/crawling/docs/crawlers-fetchers/google-common-crawlers) (2026):

> "Google-Extended does not impact a site's inclusion in Google Search nor is it used as a ranking signal."
> — Google for Developers, 2026

Los dueños de sitios se han dado cuenta de lo barato que sale ese intercambio: el Radar 2025 Year in Review de Cloudflare encontró que las directivas allow para Google-Extended se triplicaron durante 2025, justo mientras GPTBot, ClaudeBot y CCBot encabezaban la lista de bots bloqueados por completo con más frecuencia.

Bingbot es el caso contrario, con una advertencia sobre nuestra propia evidencia. Según recoge la [documentación de Bing Webmaster Tools](https://www.bing.com/webmasters/help/which-crawlers-does-bing-use-8c184ec0) —una página que no hemos podido abrir directamente para verificarla—, el mismo rastreo de Bingbot alimenta el índice de Bing Search y las respuestas de IA de Microsoft Copilot, y Microsoft publica IPs validadas en bingbot.json y recomienda la verificación por DNS. Lo marcamos como reportado, no como confirmado. Lo que sí está documentado de primera mano es el user-agent oficial —una cadena tipo Chrome que contiene bingbot/2.0, con variante móvil—, anunciado por [Microsoft](https://blogs.bing.com/webmaster/april-2022/Announcing-user-agent-change-for-Bing-crawler-bingbot) el 28 de abril de 2022. Si el relato del rastreo compartido se sostiene, entonces, a diferencia de OpenAI o Anthropic, aquí no hay palanca separada: la visibilidad en Bing y la exposición en Copilot vienen en el mismo paquete.

## ¿Cuánto rastrean los bots de IA y cuánto tráfico devuelven?

Rastrean mucho y refieren poco. A finales de 2024, [Vercel](https://vercel.com/blog/the-rise-of-the-ai-crawler) midió los volúmenes mensuales en su red: GPTBot hizo 569 millones de peticiones, Claude de Anthropic 370 millones, AppleBot 314 millones y PerplexityBot 24,4 millones. En conjunto, cerca del 20% de los 4.500 millones de Googlebot en el mismo periodo.

El mismo estudio encontró crawlers de IA llamativamente ineficientes: ChatGPT gastó el 34,82% de sus fetches en páginas 404 y Claude el 34,16%, frente al 8,22% de Googlebot. ChatGPT prioriza el HTML (57,70% de los fetches), mientras Claude se inclina por las imágenes (35,17%).

El tráfico de referencia es la parte que enfría los ánimos. Los ratios crawl-to-refer de Cloudflare —páginas rastreadas por cada visita humana referida— salen de dos posts distintos que miden cortes distintos, así que cada columna va etiquetada con el suyo:

| Operador | Todos los sitios — Cloudflare, 29 ago. 2025 (ventana de jul. 2025) | Medios de noticias — [Cloudflare, 28 ago. 2025](https://blog.cloudflare.com/ai-crawler-traffic-by-purpose-and-industry/) |
|---|---|---|
| Anthropic | 38.066:1 | 2.500:1 |
| OpenAI | 1.091:1 | 152:1 |
| Perplexity | 195:1 | 32,7:1 |
| Google | 5,4:1 | — |

> "…still crawled 38,000 pages for every referred page visit in July 2025."
> — Cloudflare sobre Anthropic, 29 de agosto de 2025

Según el [desglose por sector de Cloudflare](https://blog.cloudflare.com/ai-crawler-traffic-by-purpose-and-industry/) (agosto de 2025), ClaudeBot y GPTBot suman juntos casi la mitad del crawling de IA observado, y en el sector de noticias ChatGPT-User alcanza el 14,9% del crawling: señal de una demanda intensa de usuarios reales. La lectura estratégica para una pyme: la visibilidad en IA hoy paga en citas y presencia de marca, no en clics masivos.

## ¿Renderizan JavaScript los crawlers de IA?

No. Ninguno de los grandes crawlers de IA ejecuta JavaScript. Un estudio de [Vercel](https://vercel.com/blog/the-rise-of-the-ai-crawler) con Merj (diciembre de 2024) los probó directamente:

> "ChatGPT and Claude don't execute JavaScript."
> — Vercel, diciembre de 2024

Ni GPTBot, ni OAI-SearchBot, ni ChatGPT-User, ni ClaudeBot, ni PerplexityBot, ni Meta-ExternalAgent, ni Bytespider, ni CCBot renderizaron JS. Solo lo hicieron Gemini —vía la infraestructura de Googlebot— y AppleBot. Los bots sí descargan archivos JavaScript (el 11,50% de los fetches de ChatGPT y el 23,84% de los de Claude); simplemente nunca los ejecutan.

La implicación es contundente: si tus precios, descripciones de producto o FAQ se inyectan en el cliente, son invisibles para los asistentes de IA. El contenido crítico tiene que llegar en la respuesta HTML del servidor, mediante renderizado en servidor o generación estática. Es la misma disciplina que premia la búsqueda clásica —lo vemos en los [fundamentos de SEO técnico](/es/blog/technical-seo-foundations)— y es lo primero que revisamos en una [auditoría de SEO técnico](/es/services/seo).

## ¿Cómo configurar robots.txt para los bots de IA?

Bot a bot, línea a línea: no existe un interruptor único de IA. Poner Disallow a GPTBot bloquea solo el crawler de entrenamiento de OpenAI y deja OAI-SearchBot intacto; bloquear ClaudeBot no afecta a Claude-SearchBot ni a Claude-User. Tanto OpenAI como Anthropic advierten que bloquear sus bots de búsqueda reduce tu visibilidad y tu citación en sus respuestas.

Un punto de partida sensato para la mayoría de las pymes: permite los bots de búsqueda y de usuario, y luego toma una decisión deliberada sobre los de entrenamiento.

```
# Opción A — por defecto: permitirlo todo (no hacen falta entradas de IA)

# Opción B — bloquear el entrenamiento, mantener la visibilidad en búsqueda de IA
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

# Opción C — limitar el entrenamiento en lugar de bloquearlo
# (Anthropic documenta soporte de Crawl-delay para ClaudeBot)
User-agent: ClaudeBot
Crawl-delay: 1
```

Dos detalles operativos. Primero, OAI-SearchBot puede tardar unas 24 horas en procesar los cambios de robots.txt, según la documentación de OpenAI. Segundo, cada proveedor publica listas de IP (openai.com/gptbot.json, claude.com/crawling/bots.json, perplexity.com/perplexitybot.json) para que verifiques si un visitante que dice ser un bot lo es de verdad. Ten en cuenta además que robots.txt regula quién puede rastrear, mientras que el archivo llms.txt propone qué deberían leer primero los sistemas de IA: lo explicamos en nuestra [guía de llms.txt](/es/blog/llms-txt-guide).

## ¿Qué hacer esta semana?

Una checklist práctica para un equipo pequeño:

1. **Saca los logs de tu servidor** y busca GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-SearchBot, Claude-User, PerplexityBot y bingbot. Primero el baseline, después las opiniones.
2. **Audita tu robots.txt** contra la tabla de arriba. Confirma que ningún bot de búsqueda o de usuario está bloqueado por accidente: recuerda que solo el 14% de los dominios top tenía alguna directiva específica de IA (Cloudflare, julio de 2025).
3. **Decide tu postura sobre el entrenamiento.** Bloquear GPTBot y ClaudeBot no cuesta visibilidad en la búsqueda de IA: OpenAI y Anthropic mantienen la búsqueda en palancas separadas. Google-Extended es otro intercambio: Google afirma que no afecta la inclusión ni el ranking en Google Search, pero el mismo token también apaga el grounding, así que es el único bloqueo de entrenamiento que lleva un coste de visibilidad en IA asociado.
4. **Prueba una página clave con JavaScript desactivado** o tráela con curl. Si el contenido principal no está en el HTML crudo, los crawlers de IA no pueden verlo.
5. **Revisa los logs otra vez a las 24-48 horas**, porque OpenAI dice que OAI-SearchBot puede tardar alrededor de 24 horas en procesar los cambios de robots.txt.

Esa secuencia —baseline, implementar, medir antes y después— es exactamente la que aplicamos en nuestro [servicio de visibilidad en IA](/es/services/ai-visibility), con cada número publicado etiquetado como medido, calculado o supuesto.

## Preguntas frecuentes

### Si bloqueo GPTBot en robots.txt, ¿desaparezco de ChatGPT?

No. GPTBot solo recopila contenido para entrenar modelos; la búsqueda de ChatGPT la alimenta OAI-SearchBot, un bot distinto con su propio ajuste independiente. Puedes bloquear GPTBot (entrenamiento) y seguir apareciendo citado en ChatGPT si permites OAI-SearchBot. OpenAI indica que los cambios en robots.txt pueden tardar alrededor de 24 horas en procesarse para la búsqueda.

### ¿Los crawlers de IA ven el contenido que cargo con JavaScript?

No. Según el estudio de Vercel y Merj de diciembre de 2024, ni GPTBot, ni OAI-SearchBot, ni ClaudeBot, ni PerplexityBot ejecutan JavaScript: solo leen el HTML que devuelve el servidor y descargan los archivos JS sin ejecutarlos. Solo Gemini, vía la infraestructura de Googlebot, y AppleBot renderizan JS. Si tu contenido clave depende de JavaScript en el cliente, es invisible para los asistentes de IA.

### ¿Bloquear Google-Extended me saca de Google?

No. Google-Extended no es un crawler: es un token de robots.txt que controla si tu contenido puede usarse para entrenar modelos Gemini y para grounding. Google afirma explícitamente que no afecta la inclusión ni el ranking en Google Search. El rastreo lo siguen haciendo los user-agents normales de Google.

### ¿Cuál es la diferencia entre bots de entrenamiento, de búsqueda y de usuario?

Los de entrenamiento, como GPTBot y ClaudeBot, recopilan contenido para entrenar modelos y suponen alrededor del 80 por ciento del crawling de IA según Cloudflare. Los de búsqueda, como OAI-SearchBot, Claude-SearchBot y PerplexityBot, indexan páginas para que los motores puedan citarte, y bloquearlos reduce tu visibilidad en IA. Los de usuario, como ChatGPT-User, visitan tu página en vivo cuando una persona lo pide; esta categoría creció más de 15 veces en 2025 según Cloudflare Radar.

### ¿Cuánto tráfico real devuelven los bots de IA a mi web?

Poco, y varía mucho según el sector. Cloudflare, midiendo su propia red, publicó los ratios crawl-to-refer —páginas rastreadas por cada visita humana referida— de una ventana de julio de 2025 en su post del 29 de agosto de 2025: Anthropic rastreaba unas 38.000 páginas por cada visita referida, OpenAI unas 1.100, Perplexity unas 195 y Google 5,4. En otro post distinto de Cloudflare, el del 28 de agosto de 2025, centrado en medios de noticias, los ratios son mucho mejores: 152:1 en OpenAI y 32,7:1 en Perplexity. La apuesta GEO se sostiene en visibilidad y citación más que en volumen de clics.

### ¿Todos los bots de IA respetan robots.txt?

Los crawlers declarados de OpenAI, Anthropic y Perplexity dicen respetarlo, y Anthropic acepta además Crawl-delay. Hay excepciones documentadas: Perplexity-User generalmente ignora robots.txt por diseño, al ser una petición iniciada por el usuario, y Cloudflare documentó en agosto de 2025 crawling sigiloso de Perplexity con user-agents no declarados e IPs rotativas. Trata robots.txt como una petición de cortesía, no como una barrera técnica.

## Fuentes

Cada afirmación de este artículo enlaza a la fuente de la que procede, con su fecha de publicación.

- [OpenAI Developers — Overview of OpenAI Crawlers (página viva, consultada el 16-07-2026)](https://developers.openai.com/api/docs/bots) — 2026
- [Claude Help Center (Anthropic) — Does Anthropic crawl data from the web? (página viva, consultada el 16-07-2026)](https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler) — 2026
- [Perplexity Docs — Perplexity Crawlers (página viva, consultada el 16-07-2026)](https://docs.perplexity.ai/guides/bots) — 2026
- [Google for Developers — Google's common crawlers (página viva, consultada el 16-07-2026)](https://developers.google.com/crawling/docs/crawlers-fetchers/google-common-crawlers) — 2026
- [Bing Webmaster Blog — Announcing user-agent change for Bing crawler bingbot](https://blogs.bing.com/webmaster/april-2022/Announcing-user-agent-change-for-Bing-crawler-bingbot) — 2022-04-28
- [Bing Webmaster Tools — Which crawlers does Bing use? (reportado vía fuentes secundarias; página primaria no verificada directamente)](https://www.bing.com/webmasters/help/which-crawlers-does-bing-use-8c184ec0) — 2026
- [Vercel Blog — The rise of the AI crawler](https://vercel.com/blog/the-rise-of-the-ai-crawler) — 2024-12-17
- [Cloudflare Blog — From Googlebot to GPTBot: who's crawling your site in 2025](https://blog.cloudflare.com/from-googlebot-to-gptbot-whos-crawling-your-site-in-2025/) — 2025-07-01
- [Cloudflare Blog — The crawl-to-click gap: Cloudflare data on AI bots, training, and referrals](https://blog.cloudflare.com/crawlers-click-ai-bots-training/) — 2025-08-29
- [Cloudflare Blog — A deeper look at AI crawlers: breaking down traffic by purpose and industry](https://blog.cloudflare.com/ai-crawler-traffic-by-purpose-and-industry/) — 2025-08-28
- [Cloudflare Blog — The 2025 Cloudflare Radar Year in Review](https://blog.cloudflare.com/radar-2025-year-in-review/) — 2025-12
- [Cloudflare Blog — Perplexity is using stealth, undeclared crawlers to evade website no-crawl directives](https://blog.cloudflare.com/perplexity-is-using-stealth-undeclared-crawlers-to-evade-website-no-crawl-directives/) — 2025-08-04
