---
title: "Crawlers de IA: GPTBot, ClaudeBot e robots.txt em 2026"
description: "O que fazem GPTBot, OAI-SearchBot, ClaudeBot e PerplexityBot, porque nenhum executa JavaScript e como configurar o robots.txt bot a bot."
lang: pt
canonical: https://upgradepro.eu/pt/blog/ai-crawlers-guide
published: 2026-07-16
tags: ["GEO", "técnico"]
---

# Crawlers de IA: GPTBot, ClaudeBot e robots.txt em 2026

> O que fazem GPTBot, OAI-SearchBot, ClaudeBot e PerplexityBot, porque nenhum executa JavaScript e como configurar o robots.txt bot a bot.

Os crawlers de IA são os bots automáticos que a OpenAI, a Anthropic, a Perplexity, a Google e a Microsoft enviam para ler o seu site com três funções distintas: treinar modelos, construir índices de pesquisa e ir buscar páginas em direto quando um utilizador pergunta. Cada bot obedece ao seu próprio token de robots.txt, pelo que bloquear o errado pode retirar o seu site das respostas de IA sem que dê por isso. E, segundo os testes da Vercel com a Merj em dezembro de 2024, nenhum dos grandes crawlers de IA executa JavaScript: o que o seu servidor envia como HTML é tudo o que eles veem.

## Porque é que os crawlers de IA são decisivos para a sua visibilidade?

Porque ser rastreado é o bilhete de entrada: se um bot de pesquisa de IA nunca ler a sua página, o ChatGPT, o Claude ou a Perplexity não a podem citar. Segundo a [Cloudflare](https://blog.cloudflare.com/from-googlebot-to-gptbot-whos-crawling-your-site-in-2025/) (julho de 2025), o tráfego combinado de crawlers de IA e de pesquisa cresceu 18 % entre maio de 2024 e maio de 2025. A quota do GPTBot nesse tráfego saltou de 2,2 % para 7,7 % — um aumento de 305 % —, enquanto o Googlebot subiu de 30 % para 50 %, o ClaudeBot caiu de 11,7 % para 5,4 % e o Bingbot ficou perto de 8,7 %.

A maioria dos responsáveis por sites não reagiu. No mesmo estudo, apenas 14 % dos 3816 domínios de topo analisados tinham diretivas de robots.txt específicas para bots de IA, e o GPTBot era o bot mais bloqueado de todos (312 domínios). Ser rastreado é o primeiro passo; transformar rastreios em citações é outro problema, que abordamos em [como os motores de IA escolhem o que citar](/pt/blog/how-ai-engines-cite).

## Quais são os três tipos de bots de IA?

Todos os crawlers de IA documentados fazem uma de três coisas: treino de modelos, indexação para pesquisa ou pedidos em direto desencadeados por utilizadores. A distinção conta, porque cada tipo tem um compromisso diferente e o robots.txt permite tratá-los em separado.

Segundo a [Cloudflare](https://blog.cloudflare.com/crawlers-click-ai-bots-training/) (agosto de 2025), o treino de modelos representa cerca de 79-80 % da atividade dos bots de IA (contra 72 % em julho de 2024), a pesquisa 17 % e as ações de utilizador 3,2 %. A categoria de ação de utilizador é a que mais cresce: o [Radar 2025 Year in Review](https://blog.cloudflare.com/radar-2025-year-in-review/) da Cloudflare mediu um crescimento superior a 15x nos pedidos desencadeados por utilizadores durante 2025, com o ChatGPT-User a atingir picos de até 16x o seu nível no início do ano.

Eis a lista completa dos bots documentados e o que bloquear cada um faz realmente:

| Bot | Operador | Função | Se o bloquear no robots.txt | Corre JS |
|---|---|---|---|---|
| GPTBot | OpenAI | Treino de modelos | Conteúdos excluídos dos conjuntos de treino da OpenAI | Não |
| OAI-SearchBot | OpenAI | Índice de pesquisa do ChatGPT | O seu site deixa de aparecer nos resultados de pesquisa do ChatGPT | Não |
| ChatGPT-User | OpenAI | Pedido em direto do utilizador | Pode não se aplicar — as visitas são iniciadas pelo utilizador | Não |
| OAI-AdsBot | OpenAI | Valida páginas de destino de anúncios | — | Não testado |
| ClaudeBot | Anthropic | Treino de modelos | Material futuro excluído dos conjuntos de treino do Claude | Não |
| Claude-SearchBot | Anthropic | Índice de pesquisa do Claude | Menor visibilidade nos resultados de pesquisa do Claude | Não testado |
| Claude-User | Anthropic | Pedido em direto do utilizador | O Claude deixa de poder ir buscar as suas páginas durante as conversas | Não testado |
| PerplexityBot | Perplexity | Índice de pesquisa (não treino) | Deixa de poder ser mostrado ou ligado nos resultados da Perplexity | Não |
| Perplexity-User | Perplexity | Pedido em direto do utilizador | Geralmente ignorado, segundo a documentação da própria Perplexity | Não testado |
| Google-Extended | Google | Token que controla treino e grounding do Gemini | Sem treino nem grounding do Gemini; Pesquisa Google não é afetada | n/a |
| Bingbot | Microsoft | Índice do Bing, e consta que também alimenta as respostas do Copilot * | Sai do Bing e, ao que consta, do Copilot ao mesmo tempo * | Não testado |

Finalidades segundo a documentação oficial de cada fornecedor (2026), exceto a linha do Bingbot (*): a ligação ao Copilot chega-nos da documentação do Bing Webmaster Tools através de fontes secundárias — não conseguimos abrir a página primária, pelo que deve ser tratada como reportada, não verificada. A coluna de JavaScript reflete os testes da Vercel de finais de 2024, com os bots não testados assinalados como tal.

## Que crawlers usa a OpenAI e o que controla cada um?

A OpenAI documenta quatro crawlers, cada um com o seu token de robots.txt, a sua string de user-agent e gamas de IP publicadas, segundo a [documentação de crawlers da OpenAI](https://developers.openai.com/api/docs/bots) (2026):

1. **GPTBot** (user-agent GPTBot/1.4, IP publicados em openai.com/gptbot.json) recolhe conteúdos para treino de modelos. Bloqueá-lo exclui o seu site dos conjuntos de treino da OpenAI.
2. **OAI-SearchBot** (OAI-SearchBot/1.4) alimenta a pesquisa no ChatGPT. É permiti-lo que faz o seu site aparecer nos resultados de pesquisa do ChatGPT, e a OpenAI indica que pode demorar cerca de 24 horas a processar atualizações do robots.txt.
3. **ChatGPT-User** (ChatGPT-User/1.0) vai buscar páginas durante as conversas dos utilizadores. Como cada visita é iniciada por uma pessoa, a OpenAI afirma que o robots.txt pode não se aplicar.
4. **OAI-AdsBot** valida as páginas de destino de anúncios.

As definições são independentes entre bots. A consequência prática: pode recusar o treino da OpenAI e manter visibilidade total na pesquisa do ChatGPT — são alavancas separadas.

## O que fazem o ClaudeBot, o Claude-SearchBot e o Claude-User?

A Anthropic documenta três crawlers, todos eles respeitando o robots.txt, segundo o [Claude Help Center](https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler) (2026). O ClaudeBot recolhe conteúdos da web que podem ser usados para treinar modelos Claude e suporta a diretiva Crawl-delay. O Claude-SearchBot indexa páginas para melhorar a qualidade dos resultados de pesquisa do Claude. O Claude-User acede a uma página quando a pergunta de um utilizador ao Claude o exige.

Bloquear cada bot tem um efeito distinto e exige a sua própria entrada no robots.txt. A Anthropic afirma que, uma vez bloqueado o ClaudeBot, os materiais futuros devem ficar excluídos dos conjuntos de treino dos seus modelos. As gamas de IP publicadas estão em claude.com/crawling/bots.json, o que lhe permite verificar se o tráfego que diz ser da Claude o é de facto.

## A Perplexity respeita o robots.txt?

O crawler declarado respeita; o agente de utilizador não tem de o fazer. Segundo a [documentação de crawlers da Perplexity](https://docs.perplexity.ai/guides/bots) (2026), o PerplexityBot (PerplexityBot/1.0, IP em perplexity.com/perplexitybot.json) indexa páginas para mostrar e ligar sites nos resultados — não para treinar modelos — e respeita o robots.txt. O Perplexity-User trata das visitas iniciadas pelo utilizador e, nas palavras da própria Perplexity, "ignora geralmente as regras do robots.txt", porque cada pedido tem origem numa pessoa.

Há também um problema de credibilidade documentado. A 4 de agosto de 2025, a [Cloudflare](https://blog.cloudflare.com/perplexity-is-using-stealth-undeclared-crawlers-to-evade-website-no-crawl-directives/) acusou a Perplexity de rastreio furtivo: um user-agent Chrome genérico e não declarado a gerar 3-6 milhões de pedidos por dia, para além dos 20-25 milhões do crawler declarado, com rotação de IP e de ASN para contornar bloqueios e ignorando o robots.txt em domínios de teste. A Cloudflare retirou a Perplexity da sua lista de bots verificados. A lição é generalizável: o robots.txt é um pedido de cortesia, não uma barreira técnica.

## O Google-Extended é um crawler e o Bingbot alimenta o Copilot?

O Google-Extended não é sequer um crawler. É um token de produto autónomo para robots.txt, sem user-agent próprio — o rastreio é feito pelos user-agents já existentes da Google. O token controla se os seus conteúdos podem ser usados para treinar futuros modelos Gemini (Gemini Apps e Vertex AI) e para grounding, segundo a [documentação de crawlers da Google](https://developers.google.com/crawling/docs/crawlers-fetchers/google-common-crawlers) (2026):

> "Google-Extended does not impact a site's inclusion in Google Search nor is it used as a ranking signal."
> — Google for Developers, 2026

Os responsáveis por sites perceberam como esta troca é barata: o Radar 2025 Year in Review da Cloudflare verificou que as diretivas de autorização para o Google-Extended triplicaram durante 2025, ao mesmo tempo que o GPTBot, o ClaudeBot e o CCBot lideravam a lista dos bots mais frequentemente bloqueados por completo.

O Bingbot é o caso oposto — com uma ressalva sobre a nossa própria evidência. Conforme reportado em segunda mão a partir da [documentação do Bing Webmaster Tools](https://www.bing.com/webmasters/help/which-crawlers-does-bing-use-8c184ec0), página que não conseguimos abrir diretamente para verificar, o mesmo rastreio do Bingbot alimenta tanto o índice do Bing Search como as respostas de IA do Microsoft Copilot, e a Microsoft publica IP validados em bingbot.json e recomenda verificação por DNS. Assinalamo-lo como reportado e não confirmado. O que está documentado em primeira mão é o user-agent oficial — uma string ao estilo do Chrome contendo bingbot/2.0, com uma variante móvel —, anunciado pela [Microsoft](https://blogs.bing.com/webmaster/april-2022/Announcing-user-agent-change-for-Bing-crawler-bingbot) a 28 de abril de 2022. Se a versão do rastreio partilhado se confirmar, então, ao contrário da OpenAI ou da Anthropic, não há aqui alavanca separada: visibilidade no Bing e exposição no Copilot vêm em pacote.

## Quanto rastreiam os bots de IA — e quanto tráfego devolvem?

Rastreiam muito e referem pouco. Em finais de 2024, a [Vercel](https://vercel.com/blog/the-rise-of-the-ai-crawler) mediu volumes mensais na sua rede: o GPTBot fez 569 milhões de pedidos, o Claude da Anthropic 370 milhões, o AppleBot 314 milhões e o PerplexityBot 24,4 milhões — em conjunto, cerca de 20 % dos 4,5 mil milhões do Googlebot no mesmo período.

O mesmo estudo revelou crawlers de IA notavelmente ineficientes: o ChatGPT gastou 34,82 % dos seus pedidos em páginas 404 e o Claude 34,16 %, contra 8,22 % do Googlebot. O ChatGPT dá prioridade a HTML (57,70 % dos pedidos), enquanto o Claude pende para as imagens (35,17 %).

O tráfego de referência é a parte que faz pensar. Os rácios crawl-to-refer da Cloudflare — páginas rastreadas por cada visita humana referida — vêm de dois artigos diferentes que medem recortes diferentes, pelo que cada coluna está identificada com o seu:

| Operador | Todos os sites — Cloudflare, 29 ago. 2025 (janela de jul. 2025) | Editoras de notícias — [Cloudflare, 28 ago. 2025](https://blog.cloudflare.com/ai-crawler-traffic-by-purpose-and-industry/) |
|---|---|---|
| Anthropic | 38 066:1 | 2500:1 |
| OpenAI | 1091:1 | 152:1 |
| Perplexity | 195:1 | 32,7:1 |
| Google | 5,4:1 | — |

> "…still crawled 38,000 pages for every referred page visit in July 2025."
> — Cloudflare sobre a Anthropic, 29 de agosto de 2025

Segundo a [análise setorial da Cloudflare](https://blog.cloudflare.com/ai-crawler-traffic-by-purpose-and-industry/) (agosto de 2025), o ClaudeBot e o GPTBot representam em conjunto quase metade do rastreio de IA observado e, no setor das notícias, o ChatGPT-User chega a 14,9 % do rastreio — sinal de forte procura por parte de utilizadores reais. A leitura estratégica para uma PME: a visibilidade em IA paga-se hoje em citações e presença de marca, não em cliques em massa.

## Os crawlers de IA renderizam JavaScript?

Não — nenhum dos grandes crawlers de IA executa JavaScript. Um estudo da [Vercel](https://vercel.com/blog/the-rise-of-the-ai-crawler) com a Merj (dezembro de 2024) testou-os diretamente:

> "ChatGPT and Claude don't execute JavaScript."
> — Vercel, dezembro de 2024

Nem o GPTBot, nem o OAI-SearchBot, nem o ChatGPT-User, nem o ClaudeBot, nem o PerplexityBot, nem o Meta-ExternalAgent, nem o Bytespider, nem o CCBot renderizaram JS. Só o Gemini — através da infraestrutura do Googlebot — e o AppleBot o fizeram. Os bots continuam a descarregar ficheiros JavaScript (11,50 % dos pedidos do ChatGPT, 23,84 % dos do Claude); simplesmente nunca os correm.

A implicação é seca: se os seus preços, descrições de produto ou FAQ forem injetados do lado do cliente, são invisíveis para os assistentes de IA. Os conteúdos críticos têm de chegar na resposta HTML do servidor, por renderização do lado do servidor ou geração estática. É a mesma disciplina que a pesquisa clássica recompensa — veja as nossas [bases de SEO técnico](/pt/blog/technical-seo-foundations) — e é a primeira coisa que verificamos numa [auditoria de SEO técnico](/pt/services/seo).

## Como configurar o robots.txt para os bots de IA?

Bot a bot, linha a linha — não existe um interruptor único para a IA. Bloquear o GPTBot trava apenas o crawler de treino da OpenAI e deixa o OAI-SearchBot intocado; bloquear o ClaudeBot não afeta o Claude-SearchBot nem o Claude-User. Tanto a OpenAI como a Anthropic avisam que bloquear os seus bots de pesquisa reduz a sua visibilidade e as suas citações nas respetivas respostas.

Um ponto de partida sensato para a maioria das PME: permitir os bots de pesquisa e de utilizador e depois tomar uma decisão deliberada sobre os bots de treino.

```
# Opção A — por omissão: permitir tudo (não são precisas entradas de IA)

# Opção B — bloquear o treino de modelos, manter a visibilidade na pesquisa de IA
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

# Opção C — travar o ritmo do treino em vez de o bloquear
# (a Anthropic documenta suporte de Crawl-delay para o ClaudeBot)
User-agent: ClaudeBot
Crawl-delay: 1
```

Dois pormenores operacionais. Primeiro, o OAI-SearchBot pode demorar cerca de 24 horas a processar atualizações do robots.txt, segundo a documentação da OpenAI. Segundo, cada fornecedor publica listas de IP (openai.com/gptbot.json, claude.com/crawling/bots.json, perplexity.com/perplexitybot.json) para poder verificar se um visitante que se diz bot é genuíno. Note ainda que o robots.txt rege quem pode rastrear; o ficheiro llms.txt, separado, propõe o que os sistemas de IA devem ler primeiro — veja o nosso [guia do llms.txt](/pt/blog/llms-txt-guide).

## O que fazer esta semana?

Uma lista de verificação prática para uma equipa pequena:

1. **Vá aos registos do servidor** e procure GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-SearchBot, Claude-User, PerplexityBot e bingbot. Primeiro a baseline, depois as opiniões.
2. **Audite o seu robots.txt** com a tabela acima ao lado. Confirme que nenhum bot de pesquisa ou de utilizador está bloqueado por engano — recorde que apenas 14 % dos domínios de topo tinham sequer uma diretiva específica para IA (Cloudflare, julho de 2025).
3. **Decida a sua posição quanto ao treino.** Bloquear o GPTBot e o ClaudeBot não custa visibilidade na pesquisa de IA: a OpenAI e a Anthropic mantêm a pesquisa em alavancas separadas. O Google-Extended é outra troca — a Google afirma que não afeta a inclusão nem a classificação na Pesquisa Google, mas o mesmo token também desliga o grounding, pelo que é o único bloqueio de treino com um custo de visibilidade em IA associado.
4. **Teste uma página-chave com o JavaScript desativado** ou vá buscá-la com curl. Se o conteúdo principal não estiver no HTML em bruto, os crawlers de IA não o conseguem ver.
5. **Volte a verificar os registos ao fim de 24-48 horas**, já que a OpenAI diz que o OAI-SearchBot pode demorar cerca de 24 horas a processar alterações ao robots.txt.

Essa sequência — baseline, implementar, medir antes e depois — é exatamente o que fazemos no nosso [serviço de visibilidade em IA](/pt/services/ai-visibility), com cada número publicado etiquetado como medido, calculado ou suposto.

## Perguntas frequentes

### Se bloquear o GPTBot no robots.txt, desapareço do ChatGPT?

Não. O GPTBot apenas recolhe conteúdos para treinar modelos. A pesquisa do ChatGPT é alimentada pelo OAI-SearchBot, um bot diferente com uma definição própria e independente. Pode bloquear o GPTBot e continuar a ser citado no ChatGPT se permitir o OAI-SearchBot. A OpenAI indica que as alterações ao robots.txt podem demorar cerca de 24 horas a ser processadas para a pesquisa.

### Os crawlers de IA veem conteúdos carregados com JavaScript?

Não. Segundo o estudo da Vercel com a Merj, de dezembro de 2024, o GPTBot, o OAI-SearchBot, o ClaudeBot e o PerplexityBot não executam JavaScript: leem apenas o HTML que o seu servidor devolve e descarregam os ficheiros JS sem os correr. Só o Gemini, através da infraestrutura do Googlebot, e o AppleBot renderizam JS. Conteúdos que dependam de JavaScript do lado do cliente são invisíveis para os assistentes de IA.

### Bloquear o Google-Extended retira o meu site da Pesquisa Google?

Não. O Google-Extended não é um crawler, mas um token de robots.txt que controla se os seus conteúdos podem ser usados para treinar modelos Gemini e para grounding. A Google afirma explicitamente que não afeta a inclusão nem a classificação na Pesquisa Google. O rastreio continua a ser feito pelos user-agents normais da Google.

### Qual é a diferença entre bots de treino, de pesquisa e de utilizador?

Os bots de treino, como o GPTBot e o ClaudeBot, recolhem conteúdos para treinar modelos e representam cerca de 80 por cento do rastreio de IA, segundo a Cloudflare. Os bots de pesquisa, como o OAI-SearchBot, o Claude-SearchBot e o PerplexityBot, indexam páginas para que os motores o possam citar, e bloqueá-los reduz a sua visibilidade em IA. Os bots de utilizador, como o ChatGPT-User, vão buscar a sua página em direto quando alguém faz uma pergunta; esta categoria cresceu mais de 15x em 2025, segundo o Cloudflare Radar.

### Quanto tráfego real devolvem os bots de IA a um site?

Pouco, mas varia muito por setor. A Cloudflare, medindo a sua própria rede, publicou rácios crawl-to-refer — páginas rastreadas por cada visita humana referida — para uma janela de julho de 2025, no artigo de 29 de agosto de 2025: a Anthropic rastreou cerca de 38 000 páginas por visita referida, a OpenAI cerca de 1100, a Perplexity cerca de 195 e a Google 5,4. Num artigo separado da Cloudflare, de 28 de agosto de 2025, focado em editoras de notícias, os rácios são bastante melhores: 152:1 para a OpenAI e 32,7:1 para a Perplexity. O argumento da GEO assenta mais na visibilidade e nas citações do que no volume de cliques.

### Todos os bots de IA respeitam o robots.txt?

Os crawlers declarados da OpenAI, da Anthropic e da Perplexity afirmam respeitá-lo, e a Anthropic suporta ainda a diretiva Crawl-delay. Há exceções documentadas: o Perplexity-User ignora geralmente o robots.txt por desenho, porque o pedido é iniciado por um utilizador, e a Cloudflare documentou rastreio furtivo por parte da Perplexity em agosto de 2025, com user-agents não declarados e rotação de IP. Trate o robots.txt como um pedido de cortesia, não como uma barreira técnica.

## Fontes

Todas as afirmações deste artigo remetem para a fonte de onde provêm, com a respetiva data de publicação.

- [OpenAI Developers — Overview of OpenAI Crawlers (living page, accessed 2026-07-16)](https://developers.openai.com/api/docs/bots) — 2026
- [Claude Help Center (Anthropic) — Does Anthropic crawl data from the web? (living page, accessed 2026-07-16)](https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler) — 2026
- [Perplexity Docs — Perplexity Crawlers (living page, accessed 2026-07-16)](https://docs.perplexity.ai/guides/bots) — 2026
- [Google for Developers — Google's common crawlers (living page, accessed 2026-07-16)](https://developers.google.com/crawling/docs/crawlers-fetchers/google-common-crawlers) — 2026
- [Bing Webmaster Blog — Announcing user-agent change for Bing crawler bingbot](https://blogs.bing.com/webmaster/april-2022/Announcing-user-agent-change-for-Bing-crawler-bingbot) — 2022-04-28
- [Bing Webmaster Tools — Which crawlers does Bing use? (reported via secondary sources; primary page not directly verified)](https://www.bing.com/webmasters/help/which-crawlers-does-bing-use-8c184ec0) — 2026
- [Vercel Blog — The rise of the AI crawler](https://vercel.com/blog/the-rise-of-the-ai-crawler) — 2024-12-17
- [Cloudflare Blog — From Googlebot to GPTBot: who's crawling your site in 2025](https://blog.cloudflare.com/from-googlebot-to-gptbot-whos-crawling-your-site-in-2025/) — 2025-07-01
- [Cloudflare Blog — The crawl-to-click gap: Cloudflare data on AI bots, training, and referrals](https://blog.cloudflare.com/crawlers-click-ai-bots-training/) — 2025-08-29
- [Cloudflare Blog — A deeper look at AI crawlers: breaking down traffic by purpose and industry](https://blog.cloudflare.com/ai-crawler-traffic-by-purpose-and-industry/) — 2025-08-28
- [Cloudflare Blog — The 2025 Cloudflare Radar Year in Review](https://blog.cloudflare.com/radar-2025-year-in-review/) — 2025-12
- [Cloudflare Blog — Perplexity is using stealth, undeclared crawlers to evade website no-crawl directives](https://blog.cloudflare.com/perplexity-is-using-stealth-undeclared-crawlers-to-evade-website-no-crawl-directives/) — 2025-08-04
