← Todos os artigos

Como as IA citam fontes: ChatGPT, Perplexity, Gemini e Claude

Que índices usam o ChatGPT, o Perplexity, os AI Overviews e o Claude, os domínios mais citados e as alterações que aumentam a visibilidade até 40 %.

Os motores de IA citam fontes em dois passos: primeiro a recuperação no índice, depois a seleção da passagem. O índice muda conforme o motor — o índice próprio da Google nos AI Overviews e no Gemini, o índice proprietário do Perplexity com mais de 200 mil milhões de URL, fornecedores de pesquisa externos mais o OAI-SearchBot no ChatGPT e, segundo indica a evidência pública, o Brave Search no Claude. A seleção premeia depois páginas com estatísticas citáveis, citações textuais e fontes claras. As posições na Google não bastam: apenas 12 % dos URL citados pela IA estão no top 10 da Google para o mesmo prompt.

Porque é que interessa a forma como as IA escolhem as fontes?

As citações são o único canal pelo qual as respostas de IA devolvem leitores, e atribuição, ao seu site. A atribuição vale o suficiente para a OpenAI a pagar: segundo a OpenAI (março de 2024), os seus acordos de conteúdos com editoras como a AP, a Axel Springer, o Financial Times, a GEDI (La Repubblica, La Stampa), o Le Monde, a News Corp, a Prisa Media (El País), a Reuters, a Time e a Vox Media colocam esses conteúdos no ChatGPT em forma de resumo “com atribuição e ligações melhoradas aos artigos originais”.

Os cliques que chegam também podem comportar-se de outra maneira. Segundo o Google Search Central, os cliques provenientes de páginas de resultados com AI Overviews são de maior qualidade, no sentido em que os utilizadores tendem a passar mais tempo no site. É a Google a falar da sua própria funcionalidade — mas encaixa na razão pela qual a quota de citações passou a ser uma métrica a acompanhar ao lado das posições.

Que índice de pesquisa usa cada motor de IA?

Quatro motores, três arquiteturas de recuperação diferentes e uma dedução fundamentada. Saber que índice alimenta cada motor diz-lhe exatamente que crawler tem de conseguir chegar às suas páginas.

ChatGPT: pesquisa externa mais crawler próprio

A pesquisa do ChatGPT foi lançada a 31 de outubro de 2024. Segundo o anúncio da OpenAI, tira partido de fornecedores de pesquisa externos — historicamente o Bing — e também de conteúdos fornecidos diretamente por editoras parceiras. A página atual da OpenAI não nomeia qualquer fornecedor, por isso trate o Bing como origem histórica, não como facto confirmado no presente.

Além disso, a documentação de bots da OpenAI distingue três crawlers com funções separadas: o OAI-SearchBot alimenta a pesquisa no ChatGPT e decide que sites aparecem nos resultados; o ChatGPT-User faz visitas despoletadas por um utilizador; o GPTBot recolhe conteúdos para o treino dos modelos. Um site que bloqueie o OAI-SearchBot no robots.txt não aparece nas respostas de pesquisa do ChatGPT.

Perplexity: índice próprio, desenhado para citar fragmentos

O Perplexity opera o seu próprio crawler, o PerplexityBot, que segundo a documentação oficial existe apenas para mostrar e ligar sites nos resultados — não é usado para recolher conteúdos destinados ao treino de modelos fundacionais. Um agente separado, o Perplexity-User, trata das visitas iniciadas pelo utilizador e pode ignorar o robots.txt.

A escala é invulgar para uma startup: segundo um artigo da Perplexity Research (15 de julho de 2026), a sua infraestrutura de pesquisa acompanha mais de 200 mil milhões de URL únicos, combina recuperação lexical e semântica e trata secções e fragmentos de documento como unidades de primeira classe, para que o motor possa citar a passagem mais atómica possível. A consequência prática: secções autónomas, que respondem a uma pergunta cada, são aquilo que este desenho de recuperação recompensa.

Gemini e AI Overviews: índice da Google mais query fan-out

A Google é invulgarmente explícita quanto aos requisitos de entrada.

“Não há requisitos adicionais para aparecer nos AI Overviews ou no AI Mode, nem são necessárias outras otimizações especiais.” — Google Search Central, AI Features and Your Website (consultado em julho de 2026)

Estar indexado e elegível para snippet é o bilhete completo. Os AI Overviews e o AI Mode aplicam depois uma técnica a que a Google chama query fan-out: lançar várias pesquisas relacionadas por subtemas e fontes de dados, o que segundo a Google faz emergir um conjunto de ligações mais amplo e diverso do que a pesquisa clássica. Falta uma distinção importante: o Google-Extended controla se os seus conteúdos treinam ou fundamentam o Gemini — não controla a presença nas funcionalidades de IA da Pesquisa.

A Anthropic nunca nomeou o seu fornecedor de pesquisa. A evidência aponta para o Brave Search: a TechCrunch noticiou (21 de março de 2025) que a Anthropic acrescentou o Brave Search à sua lista de subcontratantes e que o código da funcionalidade continha um parâmetro BraveSearchParams; a TechCrunch encontrou ainda pelo menos uma pesquisa em que o Claude e o Brave devolveram citações idênticas. A própria Anthropic mantém três crawlers bloqueáveis em separado, segundo o seu Centro de Ajuda: ClaudeBot (treino), Claude-User (visitas iniciadas pelo utilizador) e Claude-SearchBot (qualidade dos resultados de pesquisa).

Que domínios são mais citados pelas IA?

A Wikipedia aparece no topo das três grandes plataformas e é o domínio número um no ChatGPT (16,3 %), embora a Ahrefs meça o YouTube acima dela no Perplexity e nos AI Overviews. Cada motor mantém uma dieta de fontes distinta. A Ahrefs (11 de junho de 2025) analisou 78,6 milhões de interações com dados de junho de 2025:

DomínioChatGPTPerplexityGoogle AI Overviews
Wikipedia16,3 %12,5 %8,4 %
YouTube16,1 %9,5 %
Reddit7,4 %
Quora3,6 %
Reuters4 %

Quota de menções no estudo da Ahrefs; ”—” significa que o domínio não se destacou na lista dessa plataforma. A inclinação do ChatGPT para os meios de comunicação, como a Reuters, é coerente com os acordos da OpenAI com editoras; os AI Overviews são a única das três plataformas em que os fóruns — Reddit e Quora — entram no topo.

A Profound (junho de 2025, atualizado em agosto de 2025) mediu 680 milhões de citações entre agosto de 2024 e junho de 2025 e encontrou a mesma forma com magnitudes diferentes: a Wikipedia é a fonte número um do ChatGPT com 7,8 % de todas as citações, o Reddit lidera no Perplexity (6,6 %) e nos Google AI Overviews (2,2 %), os domínios .com concentram 80,41 % das citações e os .org 11,29 %.

Porque é que a Ahrefs e a Profound discordam sobre a quota da Wikipedia no ChatGPT (16,3 % contra 7,8 %)? Metodologias, métricas e janelas temporais diferentes. Nenhum número está errado; cada um só é válido dentro do seu estudo. Qualquer fornecedor que cite uma única “quota de citações de IA” sem nomear o estudo está a vender-lhe ruído.

Quão estáveis são estes padrões de citação?

Pouco — pelo menos no ChatGPT. A Semrush (10 de novembro de 2025) acompanhou mais de 230 000 prompts e mais de 100 milhões de citações entre 14 de julho e 12 de outubro de 2025. O Reddit caiu de aparecer em cerca de 60 % das respostas do ChatGPT para cerca de 10 % em meados de setembro de 2025, e a Wikipedia desceu de cerca de 55 % para menos de 20 %. O Google AI Mode manteve-se estável na mesma janela, com o LinkedIn (~15 %) à frente.

A lição para uma PME: uma fotografia de um mês sobre “quem é citado” não é uma estratégia. As quotas de citação no ChatGPT podem mexer dezenas de pontos em semanas, por isso qualquer esforço sério exige medição repetida — uma baseline, uma intervenção e um depois.

Posicionar bem na Google garante citações da IA?

Não. A Ahrefs estudou 15 000 consultas long-tail (11 de agosto de 2025) e concluiu que apenas 12 % dos URL citados pelos assistentes de IA estão no top 10 da Google para o prompt original.

“80 % dessas citações não posicionam em lado nenhum na Google para a consulta original.” — Ahrefs, estudo de sobreposição da pesquisa com IA (agosto de 2025)

A sobreposição varia por motor: o Perplexity é o mais alinhado com a Google, com 28,6 %, enquanto o ChatGPT fica à volta dos 8 %. Ou seja, as posições existentes transferem-se em parte para o Perplexity e quase nada para o ChatGPT. Esta distância é o argumento prático para tratar a GEO como disciplina distinta do SEO clássico: os dois canais recompensam trabalho que se sobrepõe mas não coincide, e um não compra o outro automaticamente.

Que alterações de conteúdo aumentam mesmo a probabilidade de citação?

A evidência controlada mais sólida continua a ser o artigo académico GEO (Aggarwal et al., KDD 2024), testado no GEO-bench, um benchmark de 10 000 consultas. Mostrou que otimizar os conteúdos pode aumentar a visibilidade nos motores generativos até 40 %. Um detalhe que os resumos costumam deixar cair: esses 40 % são medidos em Position-Adjusted Word Count — quanto da resposta o cita e com que destaque — e não em cliques ou tráfego.

Segundo o texto integral, as táticas mais eficazes foram:

  1. Acrescentar citações textuais de fontes: ~27,8 % de melhoria.
  2. Acrescentar estatísticas: ~25,9 %.
  3. Citar fontes: ~24,9 %.
  4. Melhorar a fluidez da escrita: ~25,1 %.

O keyword stuffing — o reflexo do SEO antigo — não funcionou. E a distribuição dos ganhos é a parte que as PME deviam ler duas vezes: os sites em posições mais baixas foram os que mais ganharam, até +115 % de visibilidade. As respostas generativas redistribuem a atenção para baixo, e é precisamente por isso que vale a pena perceber o que torna um conteúdo citável antes dos concorrentes maiores.

Deve permitir ou bloquear os crawlers de IA no robots.txt?

Separe os bots de pesquisa dos bots de treino — são user agents diferentes com consequências diferentes.

EmpresaPesquisa / citaçõesVisitas iniciadas pelo utilizadorTreino
OpenAIOAI-SearchBotChatGPT-UserGPTBot
PerplexityPerplexityBotPerplexity-User (pode ignorar o robots.txt)— (não usado para modelos fundacionais, segundo a documentação)
AnthropicClaude-SearchBotClaude-UserClaudeBot
GoogleGooglebot (índice + funcionalidades de IA)Google-Extended (treino/fundamentação do Gemini)

Bloquear o OAI-SearchBot retira-o das respostas de pesquisa do ChatGPT; bloquear o GPTBot ou o ClaudeBot apenas o exclui do treino, sem tocar na sua presença nas respostas com citação. Do lado da Google, os controlos clássicos — noindex, nosnippet, data-nosnippet, max-snippet — também limitam a sua presença nas funcionalidades de IA, enquanto o Google-Extended rege só o treino e a fundamentação do Gemini. As strings de user agent e exemplos de robots.txt para copiar estão no nosso guia de crawlers de IA.

O que deve uma PME fazer esta semana?

Cinco ações, todas exequíveis sem comprar qualquer ferramenta:

  1. Auditar o robots.txt. Confirme que o OAI-SearchBot, o PerplexityBot, o Claude-SearchBot e o Googlebot estão permitidos. Decida sobre o GPTBot e o ClaudeBot em separado — essa é uma decisão de consentimento para treino, não de visibilidade.
  2. Verificar a elegibilidade para snippet na Google. Procure diretivas noindex, nosnippet ou max-snippet colocadas por engano; segundo a Google, indexação mais elegibilidade para snippet é o único requisito de entrada nos AI Overviews.
  3. Melhorar as suas cinco páginas mais importantes com estatísticas com fonte, citações textuais e citação explícita de fontes — as três táticas com ~25-28 % de ganho medido no artigo GEO.
  4. Tornar as secções autónomas. Títulos em forma de pergunta com resposta direta nas primeiras frases, porque a recuperação do Perplexity trata os fragmentos como unidades de citação de primeira classe.
  5. Registar uma baseline. Corra mensalmente os seus 10-20 prompts de compra centrais no ChatGPT, no Perplexity e na Google e anote que domínios são citados; a Semrush mostrou que essas quotas se podem mexer dezenas de pontos em semanas.

Se quiser essa baseline medida e etiquetada com honestidade — o que é medido, o que é calculado, o que é suposto — é exatamente isso que a nossa auditoria de visibilidade em IA entrega.

Perguntas frequentes

Que índice de pesquisa usa cada motor de IA?

O ChatGPT combina fornecedores de pesquisa externos (historicamente o Bing), o seu próprio crawler OAI-SearchBot e conteúdos de editoras parceiras. O Perplexity constrói e opera um índice próprio, que acompanha mais de 200 mil milhões de URL únicos com o PerplexityBot. O Gemini e os AI Overviews usam o índice da Google. O Claude assenta quase de certeza no Brave Search: a Anthropic listou a Brave como subcontratante em março de 2025, embora nunca tenha confirmado oficialmente a relação.

Preciso de marcação especial ou de um ficheiro próprio para aparecer nos AI Overviews da Google?

Não. A Google afirma na documentação oficial que não existem requisitos adicionais nem schema especial: a sua página tem de estar indexada e elegível para mostrar um snippet na Pesquisa. Os controlos clássicos — nosnippet, data-nosnippet, max-snippet e noindex — também limitam a forma como aparece nas funcionalidades de IA.

Se já estou em primeiro lugar na Google, as IA vão citar-me?

Não necessariamente. Segundo um estudo da Ahrefs sobre 15 000 consultas long-tail, apenas 12 % dos URL citados pelos assistentes de IA estão no top 10 da Google para o mesmo prompt, e 80 % das citações não posicionam em lado nenhum na Google para a consulta original. O Perplexity é o mais alinhado com a Google, com 28,6 % de sobreposição; o ChatGPT fica à volta dos 8 %.

Que sites são mais citados pelos motores de IA?

A Wikipedia, o YouTube e o Reddit dominam, mas cada plataforma tem o seu padrão: o ChatGPT privilegia a Wikipedia e os meios de comunicação (a OpenAI tem acordos de conteúdos com várias editoras), o Perplexity favorece o YouTube e o Reddit, e os AI Overviews da Google dão mais espaço a fóruns como o Reddit e o Quora. Estas quotas são voláteis: a Semrush mediu o Reddit a cair de cerca de 60 % para cerca de 10 % das respostas do ChatGPT em poucas semanas.

Que alterações concretas de conteúdo aumentam a probabilidade de ser citado pela IA?

O artigo académico GEO (KDD 2024) concluiu que otimizar os conteúdos pode aumentar a visibilidade nos motores generativos até 40 %. Medido em Position-Adjusted Word Count — quanto da resposta o cita e com que destaque, não cliques nem tráfego — as táticas mais eficazes foram as citações textuais de fontes (~27,8 % de melhoria), as estatísticas (~25,9 %), a citação de fontes (~24,9 %) e uma melhor fluidez do texto (~25,1 %). O keyword stuffing tradicional não funcionou. Os sites em posições mais baixas foram os que mais ganharam, até +115 % de visibilidade.

Devo permitir ou bloquear os bots de IA no robots.txt?

Separe pesquisa de treino. Se quer ser citado, permita os bots de pesquisa: OAI-SearchBot da OpenAI, PerplexityBot, Claude-SearchBot e Googlebot. Bloquear o OAI-SearchBot retira-o das respostas de pesquisa do ChatGPT. Os bots de treino — GPTBot e ClaudeBot — podem ser bloqueados de forma independente, sem perder visibilidade nas respostas com citação.


Diga-nos até onde quer chegar. Dizemos-lhe, com clareza, como lá chegaríamos.

Vamos falar