---
title: "Cómo citan fuentes ChatGPT, Perplexity, Gemini y Claude"
description: "Qué índices usan ChatGPT, Perplexity, AI Overviews y Claude, los dominios más citados por la IA y los cambios que suben la visibilidad hasta un 40%."
lang: es
canonical: https://upgradepro.eu/es/blog/how-ai-engines-cite
published: 2026-07-16
tags: ["GEO", "contenidos"]
---

# Cómo citan fuentes ChatGPT, Perplexity, Gemini y Claude

> Qué índices usan ChatGPT, Perplexity, AI Overviews y Claude, los dominios más citados por la IA y los cambios que suben la visibilidad hasta un 40%.

Los motores de IA citan fuentes en dos pasos: recuperación desde un índice y selección de pasajes. El índice cambia según el motor: el de Google para AI Overviews y Gemini, el índice propio de Perplexity con más de 200.000 millones de URLs, proveedores de búsqueda de terceros más OAI-SearchBot en ChatGPT y, según sugiere la evidencia pública, Brave Search en Claude. La selección favorece páginas con estadísticas citables, citas textuales y fuentes claras. Posicionar en Google no basta: solo el 12% de las URLs citadas por la IA está en su top-10 para el mismo prompt.

## ¿Por qué importa cómo eligen fuentes los motores de IA?

Las citas son el único canal por el que las respuestas de IA devuelven lectores, y atribución, a tu sitio. Y la atribución vale tanto que OpenAI paga por ella: según [OpenAI](https://openai.com/index/global-news-partnerships-le-monde-and-prisa-media/) (marzo de 2024), sus acuerdos de contenido con editores como AP, Axel Springer, Financial Times, GEDI (La Repubblica, La Stampa), Le Monde, News Corp, Prisa Media (El País), Reuters, Time y Vox Media colocan su contenido en ChatGPT como resúmenes "con atribución y enlaces destacados a los artículos originales".

Los clics que sí llegan también podrían comportarse distinto. Según [Google Search Central](https://developers.google.com/search/docs/appearance/ai-features), los clics que salen de páginas de resultados con AI Overviews son de mayor calidad: los usuarios tienden a pasar más tiempo en el sitio. Es la afirmación de Google sobre su propio producto — pero encaja con por qué la cuota de citas ya merece medirse junto a los rankings.

## ¿Qué índice de búsqueda usa cada motor de IA?

Cuatro motores, tres arquitecturas de recuperación distintas y una conjetura fundamentada. Saber qué índice alimenta cada motor te dice exactamente qué crawler debe poder llegar a tus páginas.

### ChatGPT: búsqueda de terceros más crawler propio

ChatGPT search se lanzó el 31 de octubre de 2024. Según [el anuncio de OpenAI](https://openai.com/index/introducing-chatgpt-search/), se apoya en proveedores de búsqueda de terceros — históricamente Bing — además de contenido entregado directamente por editores socios. La página actual de OpenAI no nombra a ningún proveedor, así que trata Bing como origen histórico, no como hecho confirmado a día de hoy.

Además, la [documentación de bots](https://developers.openai.com/api/docs/bots) de OpenAI separa tres crawlers con trabajos distintos: OAI-SearchBot alimenta la búsqueda de ChatGPT y decide qué sitios aparecen en resultados; ChatGPT-User realiza las visitas que dispara un usuario; GPTBot recopila contenido para entrenar modelos. Un sitio que bloquea OAI-SearchBot en robots.txt no aparece en las respuestas de búsqueda de ChatGPT.

### Perplexity: índice propio, construido para citar fragmentos

Perplexity opera su propio crawler, PerplexityBot, que según la [documentación oficial](https://docs.perplexity.ai/guides/bots) existe solo para mostrar y enlazar sitios web en resultados — no se usa para rastrear contenido destinado al entrenamiento de modelos fundacionales. Un agente aparte, Perplexity-User, gestiona las visitas iniciadas por el usuario y puede ignorar robots.txt.

La escala es inusual para una startup: según un [artículo de Perplexity Research](https://research.perplexity.ai/articles/architecting-and-evaluating-an-ai-first-search-api) (15 de julio de 2026), su infraestructura de búsqueda rastrea más de 200.000 millones de URLs únicas, combina recuperación léxica y semántica, y trata secciones y fragmentos de documentos como unidades de primera clase para poder citar el pasaje más atómico posible. La consecuencia práctica: este diseño de recuperación premia las secciones autónomas que responden una sola pregunta cada una.

### Gemini y AI Overviews: el índice de Google más query fan-out

Google es inusualmente explícito con los requisitos de entrada.

> "No hay requisitos adicionales para aparecer en AI Overviews o AI Mode, ni son necesarias otras optimizaciones especiales."
> — [Google Search Central, AI Features and Your Website](https://developers.google.com/search/docs/appearance/ai-features) (consultado en julio de 2026)

Estar indexado y ser elegible para snippet es toda la entrada. AI Overviews y AI Mode aplican después una técnica que Google llama query fan-out: lanzar múltiples búsquedas relacionadas sobre subtemas y fuentes de datos, lo que según Google hace aflorar un conjunto de enlaces más amplio y diverso que la búsqueda clásica. Una distinción más importa: Google-Extended controla si tu contenido entrena o hace grounding de Gemini — no controla la aparición en las funciones de IA de la búsqueda.

### Claude: la pista de Brave Search

Anthropic nunca ha nombrado a su proveedor de búsqueda. La evidencia apunta a Brave Search: [TechCrunch informó](https://techcrunch.com/2025/03/21/anthropic-appears-to-be-using-brave-to-power-web-searches-for-its-claude-chatbot/) (21 de marzo de 2025) de que Anthropic añadió Brave Search a su lista de subprocesadores y de que el código de la función contenía un parámetro `BraveSearchParams`; TechCrunch encontró además al menos una búsqueda en la que Claude y Brave devolvieron citas idénticas. La propia Anthropic opera tres crawlers bloqueables por separado, según su [Help Center](https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler): ClaudeBot (entrenamiento), Claude-User (visitas iniciadas por el usuario) y Claude-SearchBot (calidad de resultados de búsqueda).

## ¿Qué dominios cita más la IA?

Wikipedia aparece en el top de las tres grandes plataformas y es el dominio número uno en ChatGPT (16,3%), aunque Ahrefs mide YouTube por encima en Perplexity y en AI Overviews. Cada motor mantiene una dieta de fuentes distinta. [Ahrefs](https://ahrefs.com/blog/top-10-most-cited-domains-ai-assistants/) (11 de junio de 2025) analizó 78,6 millones de interacciones con datos de junio de 2025:

| Dominio | ChatGPT | Perplexity | Google AI Overviews |
|---|---|---|---|
| Wikipedia | 16,3% | 12,5% | 8,4% |
| YouTube | — | 16,1% | 9,5% |
| Reddit | — | — | 7,4% |
| Quora | — | — | 3,6% |
| Reuters | 4% | — | — |

Cuota de menciones en el estudio de Ahrefs; "—" significa que el dominio no destacó en el top de esa plataforma. La inclinación de ChatGPT hacia medios de noticias como Reuters es coherente con los acuerdos de OpenAI con editores; AI Overviews es la única plataforma de las tres donde los foros — Reddit y Quora — entran en el top.

[Profound](https://www.tryprofound.com/blog/ai-platform-citation-patterns) (junio de 2025, actualizado en agosto de 2025) midió 680 millones de citas entre agosto de 2024 y junio de 2025 y encontró la misma forma con magnitudes distintas: Wikipedia es la fuente número uno de ChatGPT con el 7,8% de todas las citas, Reddit lidera en Perplexity (6,6%) y en Google AI Overviews (2,2%), los dominios .com concentran el 80,41% de las citas y los .org el 11,29%.

¿Por qué Ahrefs y Profound discrepan en la cuota de Wikipedia en ChatGPT (16,3% frente a 7,8%)? Metodologías, métricas y ventanas temporales distintas. Ninguna cifra está mal; cada una vale solo dentro de su propio estudio. Cualquier vendor que te venda una única "cuota de citas en IA" sin nombrar el estudio te está vendiendo ruido.

## ¿Son estables estos patrones de cita?

No mucho — al menos no en ChatGPT. [Semrush](https://www.semrush.com/blog/most-cited-domains-ai/) (10 de noviembre de 2025) siguió más de 230.000 prompts y más de 100 millones de citas entre el 14 de julio y el 12 de octubre de 2025. Reddit pasó de aparecer en aproximadamente el 60% de las respuestas de ChatGPT a aproximadamente el 10% a mediados de septiembre de 2025, y Wikipedia cayó de cerca del 55% a menos del 20%. Google AI Mode se mantuvo estable en la misma ventana, con LinkedIn (~15%) en cabeza.

La lección para una pyme: una foto de un mes de "a quién citan" no es una estrategia. Las cuotas de cita en ChatGPT pueden moverse decenas de puntos en semanas, así que cualquier esfuerzo serio necesita medición repetida — una línea base, una intervención y un después.

## ¿Posicionar en Google garantiza citas en la IA?

No. Ahrefs estudió [15.000 consultas long-tail](https://ahrefs.com/blog/ai-search-overlap/) (11 de agosto de 2025) y encontró que solo el 12% de las URLs citadas por asistentes de IA posiciona en el top-10 de Google para el prompt original.

> "El 80% de esas citas no posiciona en ningún lugar de Google para la consulta original."
> — Ahrefs, estudio de solapamiento de búsqueda con IA (agosto de 2025)

El solapamiento varía por motor: Perplexity es el más alineado con Google, con un 28,6%, mientras que ChatGPT ronda el 8%. Es decir, tus rankings actuales se transfieren algo a Perplexity y apenas a ChatGPT. Esta brecha es el argumento práctico para tratar la [GEO como disciplina distinta del SEO clásico](/es/blog/geo-vs-seo): los dos canales premian trabajo que se solapa pero no coincide, y uno no compra automáticamente el otro.

## ¿Qué cambios en el contenido aumentan de verdad la probabilidad de cita?

La evidencia controlada más sólida sigue siendo el paper académico GEO ([Aggarwal et al., KDD 2024](https://arxiv.org/abs/2311.09735)), probado sobre GEO-bench, un benchmark de 10.000 consultas. Demostró que optimizar el contenido puede aumentar la visibilidad en motores generativos hasta un 40%. Un matiz que los resúmenes suelen omitir: ese 40% se mide sobre Position-Adjusted Word Count — cuánto de la respuesta te cita y con qué prominencia — no sobre clics ni tráfico.

Según el [texto completo](https://ar5iv.labs.arxiv.org/html/2311.09735), las tácticas más eficaces fueron:

1. Añadir citas textuales de fuentes: ~27,8% de mejora.
2. Añadir estadísticas: ~25,9%.
3. Citar fuentes: ~24,9%.
4. Mejorar la fluidez de la redacción: ~25,1%.

El keyword stuffing — el reflejo del SEO antiguo — no funcionó. Y la distribución de las ganancias es la parte que una pyme debería leer dos veces: los sitios peor posicionados fueron los que más ganaron, hasta +115% de visibilidad. Las respuestas generativas redistribuyen la atención hacia abajo, y justo por eso conviene aprender [qué hace citable un contenido](/es/blog/citable-content) antes que tus competidores más grandes.

## ¿Permitir o bloquear los crawlers de IA en robots.txt?

Separa los bots de búsqueda de los bots de entrenamiento: son user agents distintos con consecuencias distintas.

| Empresa | Búsqueda / citas | Visitas iniciadas por el usuario | Entrenamiento |
|---|---|---|---|
| OpenAI | OAI-SearchBot | ChatGPT-User | GPTBot |
| Perplexity | PerplexityBot | Perplexity-User (puede ignorar robots.txt) | — (no se usa para modelos fundacionales, según su documentación) |
| Anthropic | Claude-SearchBot | Claude-User | ClaudeBot |
| Google | Googlebot (índice + funciones de IA) | — | Google-Extended (entrenamiento/grounding de Gemini) |

Bloquear OAI-SearchBot te saca de las respuestas de búsqueda de ChatGPT; bloquear GPTBot o ClaudeBot solo te excluye del entrenamiento, sin tocar tu presencia en las respuestas con citas. En el lado de Google, los controles clásicos — noindex, nosnippet, data-nosnippet, max-snippet — también limitan tu aparición en las funciones de IA, mientras que Google-Extended gobierna únicamente el entrenamiento y el grounding de Gemini. Los user agents exactos y ejemplos de robots.txt listos para copiar están en nuestra [guía de crawlers de IA](/es/blog/ai-crawlers-guide).

## ¿Qué puede hacer una pyme esta semana?

Cinco acciones, todas realizables sin comprar ninguna herramienta:

1. **Audita tu robots.txt.** Confirma que OAI-SearchBot, PerplexityBot, Claude-SearchBot y Googlebot están permitidos. Decide sobre GPTBot y ClaudeBot por separado — eso es una decisión de consentimiento de entrenamiento, no de visibilidad.
2. **Revisa la elegibilidad de snippet en Google.** Busca directivas noindex, nosnippet o max-snippet no intencionadas; según Google, indexación más elegibilidad de snippet es el único requisito de entrada para AI Overviews.
3. **Mejora tus cinco páginas más importantes** con estadísticas con fuente, citas textuales y referencias explícitas — las tres tácticas con ~25-28% de mejora medida en el paper GEO.
4. **Haz las secciones autónomas.** Encabezados en forma de pregunta con respuesta directa en las primeras frases, porque la recuperación de Perplexity trata los fragmentos como unidades de cita de primera clase.
5. **Registra una línea base.** Ejecuta tus 10-20 prompts de compra clave en ChatGPT, Perplexity y Google cada mes y anota qué dominios salen citados; Semrush demostró que esas cuotas pueden moverse decenas de puntos en semanas.

Si quieres esa línea base medida y etiquetada con honestidad — qué es medido, qué es calculado, qué es supuesto —, eso es exactamente lo que entrega nuestra [auditoría de visibilidad en IA](/es/services/ai-visibility).

## Preguntas frecuentes

### ¿Qué índice de búsqueda usa cada motor de IA?

ChatGPT combina proveedores de búsqueda de terceros (históricamente Bing), su propio crawler OAI-SearchBot y contenido de editores socios. Perplexity construye y opera su propio índice, que rastrea más de 200.000 millones de URLs únicas con PerplexityBot. Gemini y AI Overviews usan el índice de Google. Claude se apoya casi con certeza en Brave Search: Anthropic lo listó como subprocesador en marzo de 2025, aunque nunca ha confirmado la relación oficialmente.

### ¿Necesito un marcado o un archivo especial para aparecer en AI Overviews de Google?

No. Google afirma en su documentación oficial que no hay requisitos adicionales ni schema especial: basta con que tu página esté indexada y sea elegible para mostrar snippet en la búsqueda. Los controles clásicos — nosnippet, data-nosnippet, max-snippet y noindex — también limitan cómo apareces en las funciones de IA.

### Si ya posiciono primero en Google, ¿me citarán los motores de IA?

No necesariamente. Según un estudio de Ahrefs sobre 15.000 consultas long-tail, solo el 12% de las URLs citadas por asistentes de IA está en el top-10 de Google para el mismo prompt, y el 80% de las citas no posiciona en ningún lugar de Google para la consulta original. Perplexity es el más alineado con Google, con un 28,6% de solapamiento; ChatGPT ronda el 8%.

### ¿Qué sitios web citan más los motores de IA?

Wikipedia, YouTube y Reddit dominan, pero cada plataforma tiene su propio patrón: ChatGPT favorece Wikipedia y medios de noticias (OpenAI tiene acuerdos de contenido con varios editores), Perplexity favorece YouTube y Reddit, y AI Overviews de Google da más espacio a foros como Reddit y Quora. Son cuotas volátiles: Semrush midió cómo Reddit cayó de aproximadamente el 60% a aproximadamente el 10% de las respuestas de ChatGPT en cuestión de semanas.

### ¿Qué cambios concretos en mi contenido aumentan la probabilidad de que la IA me cite?

El paper académico GEO (KDD 2024) concluyó que optimizar el contenido puede aumentar la visibilidad en motores generativos hasta un 40%. Medido sobre Position-Adjusted Word Count — cuánto de la respuesta te cita y con qué prominencia, no clics ni tráfico —, las tácticas más eficaces fueron las citas textuales de fuentes (~27,8% de mejora), las estadísticas (~25,9%), las referencias a fuentes (~24,9%) y una mejor fluidez de redacción (~25,1%). El keyword stuffing tradicional no funcionó. Los sitios peor posicionados fueron los que más ganaron, hasta +115% de visibilidad.

### ¿Debo permitir o bloquear los bots de IA en mi robots.txt?

Separa búsqueda de entrenamiento. Si quieres que te citen, permite los bots de búsqueda: OAI-SearchBot de OpenAI, PerplexityBot, Claude-SearchBot y Googlebot. Bloquear OAI-SearchBot te saca de las respuestas de búsqueda de ChatGPT. Los bots de entrenamiento — GPTBot y ClaudeBot — se pueden bloquear por separado sin perder visibilidad en las respuestas con citas.

## Fuentes

Cada afirmación de este artículo enlaza a la fuente de la que procede, con su fecha de publicación.

- [OpenAI — Documentación de bots y crawlers](https://developers.openai.com/api/docs/bots) — 2026-07-16
- [OpenAI — Introducing ChatGPT search](https://openai.com/index/introducing-chatgpt-search/) — 2024-10-31
- [OpenAI — Global news partnerships: Le Monde and Prisa Media](https://openai.com/index/global-news-partnerships-le-monde-and-prisa-media/) — 2024-03-13
- [Perplexity — Documentación de crawlers](https://docs.perplexity.ai/guides/bots) — 2026-07-16
- [Perplexity Research — Architecting and Evaluating an AI-First Search API](https://research.perplexity.ai/articles/architecting-and-evaluating-an-ai-first-search-api) — 2026-07-15
- [Google Search Central — AI Features and Your Website](https://developers.google.com/search/docs/appearance/ai-features) — 2026-07-16
- [Anthropic — Claude Help Center: web crawlers](https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler) — 2026-07-16
- [TechCrunch — Anthropic appears to be using Brave to power web searches for Claude](https://techcrunch.com/2025/03/21/anthropic-appears-to-be-using-brave-to-power-web-searches-for-its-claude-chatbot/) — 2025-03-21
- [Ahrefs — The 10 Most Mentioned Domains for ChatGPT, Perplexity, and AI Overviews](https://ahrefs.com/blog/top-10-most-cited-domains-ai-assistants/) — 2025-06-11
- [Ahrefs — AI search overlap study](https://ahrefs.com/blog/ai-search-overlap/) — 2025-08-11
- [Semrush — The Most-Cited Domains in AI: A 3-Month Study](https://www.semrush.com/blog/most-cited-domains-ai/) — 2025-11-10
- [Profound — AI Platform Citation Patterns](https://www.tryprofound.com/blog/ai-platform-citation-patterns) — 2025-06-05
- [Aggarwal et al. — GEO: Generative Engine Optimization (arXiv 2311.09735)](https://arxiv.org/abs/2311.09735) — 2023-11-16
- [Aggarwal et al. — GEO: Generative Engine Optimization (texto completo, ar5iv — v3, junio de 2024)](https://ar5iv.labs.arxiv.org/html/2311.09735) — 2024-06-28
