---
title: "Como medir a visibilidade em IA: amostras e baselines honestos"
description: "Uma quota de citações de 9,5 % contra 6,0 % parece uma vitória até os intervalos de confiança se sobreporem. Quantas repetições precisa mesmo de fazer."
lang: pt
canonical: https://upgradepro.eu/pt/blog/measure-ai-visibility
published: 2026-07-16
tags: ["GEO", "medição"]
---

# Como medir a visibilidade em IA: amostras e baselines honestos

> Uma quota de citações de 9,5 % contra 6,0 % parece uma vitória até os intervalos de confiança se sobreporem. Quantas repetições precisa mesmo de fazer.

Medir a visibilidade em IA é amostrar uma distribuição, não ler um instrumento. Faça a mesma pergunta duas vezes ao ChatGPT, ao Gemini ou à Perplexity e obtém respostas diferentes que citam fontes diferentes. Por isso, qualquer número tirado de uma única execução — a sua quota de voz, a sua taxa de citações — é uma estimativa com margem de erro, e a margem é larga. O trabalho prático é decidir quantas repetições precisa antes de uma diferença significar alguma coisa.

## Porque é que a mesma pergunta dá respostas diferentes de cada vez?

Porque o não determinismo está inscrito na forma como estes sistemas funcionam, não numa definição que se possa desligar. A Thinking Machines Lab gerou 1000 respostas com temperatura 0 no Qwen3-235B-A22B-Instruct-2507, com o prompt "Tell me about Richard Feynman" e 1000 tokens cada.

> "Surprisingly, we generate 80 unique completions, with the most common of these occuring 78 times."
> — Thinking Machines Lab, Horace He, setembro de 2025

Oitenta respostas distintas, todas a divergir a partir do token 103. A [causa raiz que identificam](https://thinkingmachines.ai/blog/defeating-nondeterminism-in-llm-inference/) (setembro de 2025) não é a temperatura, mas a falta de invariância ao tamanho do lote: a carga do servidor varia de forma imprevisível, o que altera a ordem da acumulação em vírgula flutuante, o que altera o resultado. Isso não se controla a partir de fora. Só se pode amostrar repetidamente.

Os fornecedores concordam, discretamente. A [documentação da própria OpenAI](https://developers.openai.com/api/docs/guides/advanced-usage) (consultada a 16 de julho de 2026) promete apenas resultados "(mostly) deterministic" quando se fixa a seed, e avisa que alterações de configuração do lado deles mudam os resultados. Um estudo académico — [arXiv:2408.04667](https://arxiv.org/abs/2408.04667) (agosto de 2024), cinco modelos, incluindo o GPT-4o e o Llama-3-70B-Instruct, oito tarefas MMLU e BBH, dez repetições cada com temperature=0, top-p=1 e seed fixa — concluiu que nenhum modelo manteve 100 % de consistência. As diferenças de exatidão entre execuções idênticas chegaram a 5-15 pontos e até 70 pontos no caso extremo (Mixtral em matemática universitária: 75 % na melhor execução, 3 % na pior).

A Google documenta o mesmo para a pesquisa. Segundo o [Google Search Central](https://developers.google.com/search/docs/appearance/ai-features): "AI Mode and AI Overviews may use different models and techniques, so the set of responses and links they show will vary." A variabilidade é comportamento documentado, não uma avaria que passe com o tempo.

## Porque é que uma medição única engana quase sempre?

Porque as suas métricas são estimativas de amostra e o setor apresenta-as como factos. A demonstração publicada mais clara vem de [Quantifying Uncertainty in AI Visibility](https://arxiv.org/abs/2603.08924), de Ronald Sielinski (arXiv:2603.08924v2, junho de 2026), um estudo com 200 consultas por tema em três temas e três plataformas, amostradas ao longo de nove dias consecutivos mais 25 amostras em intervalos de dez minutos — 374 052 citações no conjunto diário.

> "These findings show that single-run visibility metrics provide a misleadingly precise picture of domain performance in generative search."
> — Sielinski, Quantifying Uncertainty in AI Visibility, junho de 2026

O exemplo dele sobre material de corrida no SearchGPT é o que convém memorizar. Em 200 consultas, o tomsguide.com apresentou 9,5 % de quota de citações e o runnersworld.com 6,0 % — uma vantagem aparente de 3,5 pontos. Mas os intervalos de confiança bootstrap a 95 % — aproximadamente 5,5 %-12,5 % e 4,0 %-8,0 % — sobrepõem-se de forma substancial. É um empate estatístico vestido de liderança.

Mais dois números quantificam a instabilidade do terreno. Repetir uma consulta idêntica devolve maioritariamente fontes diferentes: a sobreposição mediana de Jaccard ao nível do domínio é de 0,29-0,31 no Gemini, 0,33-0,40 no SearchGPT e 0,50 na Perplexity, com taxas de citação idêntica de 0,01-0,10 % no Gemini e 3-8 % nas outras duas. E a volatilidade em si é grande: um log-std de 0,5 (médias por plataforma: 0,504 Gemini, 0,421 Perplexity, 0,417 SearchGPT) significa que a quota de citações de um domínio oscila tipicamente entre cerca de 60 % e 165 % do seu valor central.

Sielinski, citando Hu et al., reporta ainda uma taxa de inconsistência de 33 % quanto à simples aparição de uma AI Overview para uma dada consulta. Não conseguimos verificar esse número na fonte original, pelo que deve ser tratado como reportado e não como medido — mas a implicação mantém-se: a primeira fonte de variância não é o que a resposta diz, é se chega a existir uma resposta de IA.

**A regra que vale a pena decorar:** qualquer diferença de quota de citações abaixo de 5-7 pontos percentuais entre duas marcas deve ser tratada como um empate. Intervalos sobrepostos nessa gama são, nas palavras de Sielinski, a norma e não a exceção.

## De quantas repetições precisa realmente?

As suficientes para que o intervalo fique mais estreito do que a diferença que lhe interessa — e o artigo publica os números, que é precisamente o que quase nenhum blog de fornecedor faz.

| Métrica | Intervalo alvo (IC 95 %) | Gemini | Perplexity | SearchGPT |
|---|---|---|---|---|
| Quota de citações | 5 pontos de amplitude (≈ ±2,5 pp) | ~40-50 consultas | ~100 consultas | ≥150 consultas |
| Prevalência de citações | 15 pontos de amplitude | ~140-150 consultas | ~140-150 consultas | ~60-80 consultas |

Fonte: [Sielinski](https://arxiv.org/abs/2603.08924), §5.7, junho de 2026.

Há uma ressalva crítica que acompanha esta tabela. Não amostre até o intervalo parecer estreito e depois pare. No SearchGPT, a convergência não é monótona: a amplitude do intervalo estreita e volta a alargar. Quem pára num ponto convenientemente estreito reporta menos incerteza do que a real. Comprometa-se antecipadamente com um tamanho de amostra fixo, em função da plataforma e do tema — nunca use o intervalo corrente como critério de paragem.

## Dá para medir o ChatGPT com a API da OpenAI?

Dá, mas não estará a medir aquilo que os seus clientes veem. A [Surfer SEO](https://surferseo.com/blog/llm-scraped-ai-answers-vs-api-results/) (fevereiro de 2026) reporta que apenas 24 % das marcas coincidem entre os resultados da API e os resultados do ChatGPT obtidos por scraping, e que no caso das fontes citadas a sobreposição desaba para 4 %. Na Perplexity, a sobreposição de fontes entre API e interface é de 8 %.

**Nota metodológica, porque importa:** a Surfer descreve "1,000 prompt executions" sem especificar se são prompts únicos ou repetições, que versões de modelo foram usadas, ou se a pesquisa web estava ativada nas chamadas à API. Não é revisto por pares e o fornecedor tem interesse comercial na conclusão. Publicamo-lo como evidência indicativa, não como número medido.

Os dados estruturais da própria Surfer apontam no mesmo sentido, embora venham do mesmo fornecedor e do mesmo estudo não arbitrado: a API do ChatGPT tem uma média de 406 palavras contra 743 da interface obtida por scraping, cerca de 23 % das chamadas à API nunca acionam pesquisa web (a interface aciona sempre), cerca de 25 % das respostas da API não citam qualquer fonte (7 em média quando citam, contra 16 na interface) e a API falha a deteção de marcas em cerca de 8 % dos casos.

## Que métricas significam mesmo alguma coisa?

Comece por separar menção de citação: uma menção é o modelo escrever o seu nome; uma citação é o modelo ligar a si como fonte. Mecânicas diferentes, correções diferentes. Para além disso, Sielinski formaliza três:

1. **Contagem de citações** — citações absolutas ao seu domínio. Não comparável entre plataformas.
2. **Quota de citações** — as suas citações a dividir pelo total de citações. Normalizada, comparável.
3. **Prevalência de citações** — a fração de respostas que contêm pelo menos uma citação a si. Mede a amplitude da cobertura, não a profundidade.

As três são estimadores de amostra, não propriedades fixas do sistema. Para a proeminência dentro da resposta, o [artigo sobre GEO](https://arxiv.org/abs/2311.09735) (Aggarwal et al., KDD 2024, GEO-bench com 10 000 consultas) propõe o Position-Adjusted Word Count — palavras atribuídas à sua fonte, descontadas exponencialmente pela posição — e a Subjective Impression, que pontua sete dimensões, incluindo relevância, influência, singularidade e probabilidade de clique.

Uma regra rígida: nunca compare contagens brutas entre plataformas. O volume mediano de citações anda nas 5-7 por resposta no SearchGPT contra 36-40 no Gemini. Uma contagem que parece impressionante no Gemini pode estar abaixo da média nessa plataforma e ser excelente no SearchGPT. A nossa [comparação de ferramentas de visibilidade em IA](/pt/blog/ai-visibility-tools) aprofunda que plataformas reportam que métrica.

## Como se constrói um baseline gratuito, passo a passo?

Não precisa de software empresarial para começar, e o Google Search Console não o vai ajudar: segundo o [Google Search Central](https://developers.google.com/search/docs/appearance/ai-features), o tráfego proveniente das funcionalidades de IA não é discriminado à parte — está integrado no tipo de pesquisa "Web". É por causa dessa lacuna que tem de amostrar por si.

1. **Fixe 30 a 50 perguntas reais com intenção de compra.** Comparações, "melhor X para Y", "alternativas a Z" — as que os seus clientes fazem mesmo, não as que gostaria que fizessem.
2. **Execute com a sessão terminada.** A personalização contamina a amostra.
3. **Decida antecipadamente o número de repetições.** Use a tabela acima; escreva o número antes de começar.
4. **Registe quatro campos por execução.** Aparece? Em que posição? Ao lado de que concorrentes? É citado ou apenas mencionado?
5. **Compare por intervalo, não por ponto.** Se a diferença for inferior a 5-7 pontos, está empatado. Diga-o.

Vale também a pena saber: a Google afirma que não há requisitos adicionais nem marcação especial — nenhum ficheiro de texto para IA, nenhum schema à medida — para aparecer nas AI Overviews ou no AI Mode. Quem lhe vender um ficheiro mágico está a vender-lhe nada. Se está a chegar agora à disciplina, a nossa introdução sobre [o que é GEO](/pt/blog/what-is-geo) cobre primeiro os fundamentos.

## Quanto custa mesmo amostrar pela API?

Dezenas de dólares, não milhares — e o que domina é a ferramenta de pesquisa web, não os tokens. Com base nos [preços oficiais da OpenAI](https://developers.openai.com/api/docs/pricing) (consultados a 16 de julho de 2026): o gpt-5.4-mini custa 0,75 dólares por milhão de tokens de entrada e 4,50 por milhão de saída; o gpt-5.4-nano, 0,20 e 1,25; o gpt-5.6-luna, 1,00 e 6,00. A ferramenta de pesquisa web é faturada à parte, a 10,00 dólares por 1000 chamadas, mais o conteúdo recuperado às tarifas do modelo.

**CALCULADO** — um baseline de 50 prompts × 30 repetições = 1500 chamadas com pesquisa ativada. Ferramenta de pesquisa: 1,5 × 10,00 dólares = 15,00 dólares. Assumindo (**PRESSUPOSTO**, não medido) ~5000 tokens de entrada por chamada no gpt-5.4-mini — um valor pensado para cobrir o prompt *e* o conteúdo de pesquisa recuperado, que é faturado às tarifas do modelo — e ~800 tokens de saída: 7,5 M de entrada × 0,75 = 5,63 dólares, e 1,2 M de saída × 4,50 = 5,40 dólares. Total ≈ 26 dólares. Volte a verificar os preços no dia em que correr o exercício; os nomes de modelo e as tarifas desta família mudam com frequência. E lembre-se do que comprou: isto mede a API, não o ChatGPT.

## O que faz mesmo diferença depois de ter um baseline?

A evidência correlacional aponta para a notoriedade de marca e não para o volume que se publica. A [Ahrefs](https://ahrefs.com/blog/ai-brand-visibility-correlations/) (dezembro de 2025) estudou 75 000 domínios com DR acima de 40 no ChatGPT, no AI Mode e nas AI Overviews:

| Fator | Correlação com menções em IA |
|---|---|
| Menções no YouTube | ~0,737 |
| Menções de marca na web | 0,656-0,709 |
| Anchors de marca | 0,511-0,628 |
| Volume de pesquisa de marca | 0,352-0,466 |
| Domain Rating | 0,266-0,326 |
| Volume de conteúdos (número de páginas do site) | ~0,194 ("almost no relationship") |

Isto é correlação, não causalidade. Lançar um canal de YouTube não vai fazer o ChatGPT citá-lo; a leitura mais provável é que tanto as menções no YouTube como as menções em IA medem a mesma notoriedade de marca subjacente. Não prometemos o contrário, e ninguém o deveria fazer. Para perceber a que ritmo estas superfícies estão a crescer, veja a nossa nota sobre a [adoção da pesquisa com IA](/pt/blog/ai-search-adoption).

## Quando vale a pena pagar uma ferramenta e o que deve exigir?

O limiar é aritmético: prompts × repetições × plataformas ÷ tempo disponível de uma pessoa. Abaixo dele, ganha a folha de cálculo. Acima dele, compre — mas interrogue primeiro o fornecedor:

- Mede o produto real ou a API? (Lembre-se dos 24 %.)
- Reporta intervalos de confiança ou apenas um número?
- O tamanho da amostra está declarado?
- Qual é a frequência de reamostragem e está fixada antecipadamente?

Se um fornecedor lhe entregar uma quota de voz sem margem de erro, está a vender-lhe ruído com casa decimal.

## O que deve uma PME fazer esta semana?

Escolha as suas 30 a 50 perguntas, decida o número de repetições antes de olhar para qualquer resultado, corra-as com a sessão terminada no ChatGPT, na Perplexity e no Google, e registe menção e citação em separado. Depois repita a mesma amostra fixa todos os meses e compare intervalos, não pontos. Qualquer movimento abaixo de 5-7 pontos é meteorologia, não clima.

Se preferir que esse baseline seja construído e defendido por nós, é isso que faz o nosso [serviço de visibilidade em IA](/pt/services/ai-visibility) — e o nosso [método](/pt/method) etiqueta cada número como medido, calculado ou pressuposto, para que saiba sempre qual é qual.

## Perguntas frequentes

### Quantas vezes tenho de repetir a mesma pergunta para medir bem a visibilidade em IA?

Depende da plataforma e da métrica, e já existem números publicados. Segundo o artigo de Ronald Sielinski (arXiv:2603.08924, junho de 2026), um intervalo de confiança de 95 % com cerca de cinco pontos percentuais de amplitude na quota de citações, ou seja uma margem de aproximadamente mais ou menos 2,5 pontos, exige cerca de 40 a 50 consultas no Google Gemini, cerca de 100 na Perplexity e 150 ou mais no OpenAI SearchGPT. Para a prevalência de citações com intervalos de quinze pontos, o SearchGPT precisa de 60 a 80 consultas, enquanto o Gemini e a Perplexity precisam de quase o dobro, cerca de 140 a 150. A razão é que repetir a mesma consulta devolve maioritariamente fontes diferentes: a sobreposição mediana ao nível do domínio entre duas execuções idênticas é apenas de 0,29 a 0,31 no Gemini e de 0,50 na Perplexity. Uma medição única não é uma medição. É uma amostra de uma distribuição.

### Porque é que o ChatGPT dá respostas diferentes à mesma pergunta se eu puser a temperatura a zero?

Porque a temperatura só controla a fase de amostragem de tokens, não o resto do sistema. A Thinking Machines Lab demonstrou em setembro de 2025 que gerar 1000 respostas com temperatura 0 e o mesmo prompt produziu 80 respostas únicas. A causa raiz que identificam não é a temperatura, mas a falta de invariância ao tamanho do lote: a carga do servidor varia de forma imprevisível e altera a ordem da acumulação em vírgula flutuante. A própria documentação da OpenAI apenas promete resultados maioritariamente deterministas, mesmo quando se fixa o parâmetro seed. E um estudo académico (arXiv:2408.04667) confirmou que com temperature=0, top-p=1 e uma seed fixa, nenhum dos cinco modelos testados manteve 100 % de consistência. A variabilidade não se elimina. Mede-se.

### Posso medir a minha visibilidade no ChatGPT através da API da OpenAI?

Pode, mas não estará a medir aquilo que os seus clientes veem. A Surfer SEO publicou em fevereiro de 2026 que apenas 24 % das marcas coincidem entre as respostas da API e as respostas do ChatGPT obtidas por scraping, e que no caso das fontes citadas a sobreposição cai para 4 %. As diferenças estruturais explicam-no: a API tem uma média de 406 palavras contra 743 na interface, cerca de 23 % das chamadas à API nem sequer acionam pesquisa web, enquanto a interface aciona sempre, e cerca de 25 % não devolvem qualquer fonte. Esse estudo não publica versões de modelo nem a configuração de pesquisa web, pelo que deve ser lido como indicativo e não como preciso. A direção continua coerente: o produto real transporta camadas como a pesquisa, os prompts de sistema e a personalização que a API não reproduz.

### Que métricas devo acompanhar: menções, citações, posição ou sentimento?

Comece por distinguir menção de citação. Uma menção é a IA escrever o seu nome. Uma citação é a IA ligar a si como fonte. São coisas diferentes e otimizam-se de maneiras diferentes. A literatura formaliza três métricas de citação (Sielinski, 2026): contagem de citações, que não é comparável entre plataformas; quota de citações, a sua fração do total de citações, que é comparável; e prevalência de citações, a fração de respostas em que aparece pelo menos uma vez. O artigo académico sobre GEO apresentado na KDD 2024 acrescenta a proeminência dentro da resposta, com o Position-Adjusted Word Count e a Subjective Impression, que cobre sete dimensões, incluindo relevância, influência e probabilidade de clique. O sentimento é uma camada à parte: não altera a sua quota, altera quanto vale cada aparição. Para uma PME, começar pela prevalência e pela quota é suficiente.

### Consigo construir um baseline de graça ou tenho mesmo de pagar uma ferramenta?

Pode começar de graça e, para muitas PME, essa é a opção sensata. O método: fixe um conjunto de 30 a 50 perguntas reais com intenção de compra que os seus clientes fazem, decida antecipadamente quantas repetições vai executar, corra-as no ChatGPT, na Perplexity e no Google, e registe numa folha de cálculo se aparece, em que posição e ao lado de que concorrentes. Dois avisos com base na evidência. Primeiro, não use a regra de repetir até o número estabilizar e depois parar. Sielinski mostra que no SearchGPT a amplitude do intervalo estreita e volta a alargar, pelo que quem pára num ponto favorável está a enganar-se a si próprio. Segundo, execute com a sessão terminada, para que a personalização não contamine a amostra. Paga-se uma ferramenta quando prompts vezes repetições vezes plataformas deixa de caber no tempo de uma pessoa, não antes.

### Quanto custa amostrar pela API e com que frequência devo voltar a medir?

Os preços oficiais da OpenAI (consultados a 16 de julho de 2026) permitem calcular: o gpt-5.4-mini custa 0,75 dólares por milhão de tokens de entrada e 4,50 por milhão de saída, e o gpt-5.4-nano custa 0,20 e 1,25. O custo dominante não são os tokens, é a ferramenta de pesquisa web, faturada à parte a 10 dólares por 1000 chamadas mais os tokens do conteúdo recuperado. Assim, um baseline de 50 prompts com 30 repetições, ou seja 1500 chamadas com pesquisa ativada, fica na casa das dezenas de dólares e não dos milhares, mas convém lembrar que mede a API e não o produto real. Quanto à frequência: o estudo de referência mostra volatilidade de dia para dia e até em intervalos de dez minutos, pelo que voltar a amostrar diariamente sem intervalos de confiança só produz ruído com ar de tendência. Para uma PME, um ciclo mensal com um tamanho de amostra fixo, comparado por intervalos e não por ponto, é defensável. Semanal só se o seu setor se mexer depressa.

## Fontes

Todas as afirmações deste artigo remetem para a fonte de onde provêm, com a respetiva data de publicação.

- [Sielinski, Quantifying Uncertainty in AI Visibility: A Statistical Framework for Generative Search Measurement (arXiv 2603.08924v2)](https://arxiv.org/abs/2603.08924) — 2026-06-09
- [Thinking Machines Lab — Horace He, Defeating Nondeterminism in LLM Inference](https://thinkingmachines.ai/blog/defeating-nondeterminism-in-llm-inference/) — 2025-09-10
- [Atil, Aykent, Passonneau, Baldwin et al., Non-Determinism of Deterministic LLM Settings (arXiv 2408.04667)](https://arxiv.org/abs/2408.04667) — 2024-08-08
- [OpenAI — API docs, Advanced usage (Reproducible outputs)](https://developers.openai.com/api/docs/guides/advanced-usage) — 2026-07-16
- [OpenAI — API Pricing](https://developers.openai.com/api/docs/pricing) — 2026-07-16
- [Surfer SEO — Jakub Sadowski, Scraped AI Answers vs. API Results from LLMs](https://surferseo.com/blog/llm-scraped-ai-answers-vs-api-results/) — 2026-02-03
- [Ahrefs — Top Brand Visibility Factors in ChatGPT, AI Mode, and AI Overviews (75k Brands Studied)](https://ahrefs.com/blog/ai-brand-visibility-correlations/) — 2025-12-12
- [Google Search Central — AI Features and Your Website](https://developers.google.com/search/docs/appearance/ai-features) — 2026-07-16
- [Aggarwal et al., GEO: Generative Engine Optimization (arXiv 2311.09735), KDD 2024](https://arxiv.org/abs/2311.09735) — 2024-06-28
