Cómo medir la visibilidad en IA: muestras y baselines honestos
Un 9,5% frente a un 6,0% de cuota de citas parece una victoria hasta que los intervalos de confianza se solapan. Cuántas repeticiones necesitas de verdad.
Medir la visibilidad en IA es muestrear una distribución, no leer un instrumento. Pregúntale dos veces lo mismo a ChatGPT, Gemini o Perplexity y obtendrás respuestas distintas que citan fuentes distintas. Por eso cualquier cifra de una sola pasada —tu share of voice, tu tasa de citas— es una estimación con margen de error, y el margen es ancho. El trabajo práctico consiste en decidir cuántas repeticiones necesitas antes de que una diferencia signifique algo.
¿Por qué la misma pregunta da respuestas distintas cada vez?
Porque el indeterminismo está incrustado en cómo funcionan estos sistemas, no en un ajuste que puedas desactivar. Thinking Machines Lab muestreó 1.000 respuestas a temperatura 0 de Qwen3-235B-A22B-Instruct-2507 con el prompt “Tell me about Richard Feynman”, de 1.000 tokens cada una.
“Surprisingly, we generate 80 unique completions, with the most common of these occuring 78 times.” — Thinking Machines Lab, Horace He, septiembre de 2025
Ochenta respuestas distintas, todas divergiendo a partir del token 103. La causa raíz que identifican (septiembre de 2025) no es la temperatura sino la falta de invariancia al tamaño de lote: la carga del servidor varía de forma impredecible, eso cambia el orden de acumulación en coma flotante, y eso cambia la salida. No lo puedes controlar desde fuera. Solo puedes muestrear repetidamente.
Los vendors lo admiten, en voz baja. La propia documentación de OpenAI (consultada el 16 de julio de 2026) solo promete “(mostly) deterministic outputs” cuando fijas la semilla, y advierte de que los cambios de configuración en su lado alteran los resultados. Un estudio académico —arXiv:2408.04667 (agosto de 2024), cinco modelos entre ellos GPT-4o y Llama-3-70B-Instruct, ocho tareas de MMLU y BBH, diez repeticiones cada una con temperature=0, top-p=1 y semilla fija— no encontró ningún modelo que mantuviera el 100% de consistencia. Las diferencias de acierto entre ejecuciones idénticas llegaron a 5-15 puntos, y hasta 70 puntos en el caso extremo (Mixtral en matemáticas universitarias: 75% en su mejor pasada, 3% en la peor).
Google documenta lo mismo para la búsqueda. Según Google Search Central: “AI Mode and AI Overviews may use different models and techniques, so the set of responses and links they show will vary.” La variabilidad es comportamiento documentado, no un fallo que se arregle esperando.
¿Por qué una sola medición casi siempre engaña?
Porque tus métricas son estimaciones muestrales y la industria las publica como hechos. La demostración publicada más clara viene de Quantifying Uncertainty in AI Visibility de Ronald Sielinski (arXiv:2603.08924v2, junio de 2026), un estudio de 200 consultas por tema en tres temas y tres plataformas, muestreadas durante nueve días consecutivos más 25 muestras a intervalos de diez minutos: 374.052 citas en el conjunto diario.
“These findings show that single-run visibility metrics provide a misleadingly precise picture of domain performance in generative search.” — Sielinski, Quantifying Uncertainty in AI Visibility, junio de 2026
Su ejemplo con material de running en SearchGPT es el que conviene memorizar. En 200 consultas, tomsguide.com obtuvo un 9,5% de cuota de citas y runnersworld.com un 6,0%: una ventaja aparente de 3,5 puntos. Pero los intervalos de confianza bootstrap al 95% —aproximadamente 5,5%-12,5% y 4,0%-8,0%— se solapan de forma sustancial. Es un empate estadístico disfrazado de liderazgo.
Dos cifras más cuantifican lo movedizo del terreno. Repetir una consulta idéntica devuelve fuentes mayormente distintas: el solapamiento Jaccard mediano a nivel de dominio es de 0,29-0,31 en Gemini, 0,33-0,40 en SearchGPT y 0,50 en Perplexity, con tasas de citas idénticas del 0,01-0,10% en Gemini y del 3-8% en las otras dos. Y la volatilidad en sí es grande: una desviación típica logarítmica de 0,5 (medias por plataforma: 0,504 Gemini, 0,421 Perplexity, 0,417 SearchGPT) implica que la cuota de citas de un dominio oscila típicamente entre el 60% y el 165% de su valor central.
Sielinski, citando a Hu et al., recoge además una tasa de inconsistencia del 33% en si un AI Overview llega a aparecer siquiera para una consulta dada. No pudimos verificar esa cifra en la fuente original, así que trátala como reportada y no como medida; pero la implicación se sostiene: la primera fuente de varianza no es lo que dice la respuesta, es si existe una respuesta de IA.
La regla que merece la pena memorizar: cualquier diferencia de cuota de citas por debajo de 5-7 puntos porcentuales entre dos marcas debe tratarse como un empate. Los intervalos solapados en ese rango son, en palabras de Sielinski, la norma y no la excepción.
¿Cuántas repeticiones necesitas de verdad?
Las suficientes para que el intervalo sea más estrecho que la diferencia que te importa. Y el paper publica los números, que es exactamente lo que casi ningún blog de vendor hace.
| Métrica | Intervalo objetivo (IC 95%) | Gemini | Perplexity | SearchGPT |
|---|---|---|---|---|
| Cuota de citas | 5 puntos de ancho (≈ ±2,5 pp) | ~40-50 consultas | ~100 consultas | ≥150 consultas |
| Prevalencia de citas | 15 puntos de ancho | ~140-150 consultas | ~140-150 consultas | ~60-80 consultas |
Fuente: Sielinski, §5.7, junio de 2026.
Esa tabla viene con una advertencia crítica. No muestrees hasta que el intervalo parezca estrecho y entonces pares. En SearchGPT la convergencia no es monótona: el ancho del intervalo se estrecha y luego se vuelve a ensanchar. Quien para en un punto afortunadamente estrecho reporta menos incertidumbre de la que hay. Comprométete de antemano con un tamaño de muestra fijo, según la plataforma y el tema, y nunca uses el intervalo en curso como criterio de parada.
¿Se puede medir ChatGPT con la API de OpenAI?
Puedes, pero no estarás midiendo lo que ven tus clientes. Surfer SEO (febrero de 2026) informa de que solo un 24% de las marcas coincide entre los resultados de la API y los de ChatGPT extraídos por scraping, y que en las fuentes citadas el solapamiento se desploma al 4%. En Perplexity, el solapamiento de fuentes entre API e interfaz es del 8%.
Nota metodológica, porque importa: Surfer describe “1.000 ejecuciones de prompts” sin especificar si son prompts únicos o repeticiones, qué versiones de modelo se usaron, ni si la búsqueda web estaba activada en las llamadas a la API. No tiene revisión por pares, y el vendor tiene interés comercial en la conclusión. Lo publicamos como evidencia orientativa, no como cifra medida.
Los propios datos estructurales de Surfer apuntan en la misma dirección, aunque vengan del mismo vendor y del mismo estudio sin revisión por pares: la API de ChatGPT promedia 406 palabras frente a 743 de la interfaz scrapeada, alrededor del 23% de las llamadas a la API nunca dispara una búsqueda web (la interfaz siempre lo hace), en torno al 25% de las respuestas de la API no cita ninguna fuente (7 de media cuando sí lo hace, frente a 16 en la interfaz), y la API no detecta la marca aproximadamente un 8% de las veces.
¿Qué métricas significan algo de verdad?
Empieza separando la mención de la cita: una mención es el modelo escribiendo tu nombre; una cita es el modelo enlazándote como fuente. Mecánicas distintas, arreglos distintos. Más allá de eso, Sielinski formaliza tres:
- Recuento de citas — citas absolutas a tu dominio. No comparable entre plataformas.
- Cuota de citas — tus citas divididas por el total de citas. Normalizada, comparable.
- Prevalencia de citas — la fracción de respuestas que contienen al menos una cita tuya. Mide amplitud de cobertura, no profundidad.
Las tres son estimadores muestrales, no propiedades fijas del sistema. Para la prominencia dentro de la respuesta, el paper de GEO (Aggarwal et al., KDD 2024, GEO-bench de 10.000 consultas) propone Position-Adjusted Word Count —palabras atribuidas a tu fuente, descontadas exponencialmente por posición— y Subjective Impression, que puntúa siete dimensiones incluidas relevancia, influencia, unicidad y probabilidad de clic.
Una regla dura: nunca compares recuentos brutos entre plataformas. El volumen mediano de citas va de 5-7 por respuesta en SearchGPT a 36-40 en Gemini. Un recuento que parece impresionante en Gemini puede estar por debajo de la media allí y ser excelente en SearchGPT. Nuestra comparativa de herramientas de visibilidad en IA profundiza en qué plataforma reporta qué métrica.
¿Cómo montar un baseline gratis, paso a paso?
No necesitas software enterprise para empezar, y Google Search Console no te va a ayudar: según Google Search Central, el tráfico de las funciones de IA no se desglosa aparte — va agregado dentro del tipo de búsqueda “Web”. Ese hueco es la razón por la que muestreas tú.
- Fija 30-50 preguntas reales con intención de compra. Comparativas, “mejor X para Y”, “alternativas a Z”: las que tus clientes hacen de verdad, no las que te gustaría que hicieran.
- Ejecuta sin sesión iniciada. La personalización contamina la muestra.
- Decide el número de repeticiones de antemano. Usa la tabla de arriba; apunta el número antes de empezar.
- Registra cuatro campos por pasada. ¿Apareces? ¿En qué posición? ¿Junto a qué competidores? ¿Te citan o solo te mencionan?
- Compara por intervalo, no por punto. Si la diferencia es menor de 5-7 puntos, estás empatado. Dilo.
Otra cosa que conviene saber: Google afirma que no hay requisitos adicionales ni marcado especial —ni ficheros de texto para IA, ni schema a medida— para aparecer en AI Overviews o AI Mode. Quien te venda un fichero mágico no te está vendiendo nada. Si acabas de llegar a la disciplina, nuestra introducción a qué es GEO cubre antes los fundamentos.
¿Cuánto cuesta de verdad muestrear por API?
Decenas de dólares, no miles. Y lo que domina es la herramienta de búsqueda web, no los tokens. Según los precios oficiales de OpenAI (consultados el 16 de julio de 2026): gpt-5.4-mini cuesta $0,75 por millón de tokens de entrada y $4,50 por millón de salida; gpt-5.4-nano, $0,20 y $1,25; gpt-5.6-luna, $1,00 y $6,00. La herramienta de búsqueda web se factura aparte a $10,00 por cada 1.000 llamadas, más el contenido recuperado a tarifa de modelo.
CALCULADO — un baseline de 50 prompts × 30 repeticiones = 1.500 llamadas con búsqueda activada. Herramienta de búsqueda: 1,5 × $10,00 = $15,00. Suponiendo (SUPUESTO, no medido) unos 5.000 tokens de entrada por llamada en gpt-5.4-mini —una cifra pensada para englobar el prompt y el contenido de búsqueda recuperado, que se factura a tarifa de modelo— y unos 800 tokens de salida: 7,5 M de entrada × $0,75 = $5,63, y 1,2 M de salida × $4,50 = $5,40. Total ≈ $26. Vuelve a verificar los precios el día que lo ejecutes; los nombres de modelo y las tarifas de esta familia cambian a menudo. Y recuerda qué has comprado: esto mide la API, no ChatGPT.
¿Qué mueve la aguja una vez que tienes el baseline?
La evidencia correlacional apunta a la notoriedad de marca más que a cuánto publicas. Ahrefs (diciembre de 2025) estudió 75.000 dominios con DR por encima de 40 en ChatGPT, AI Mode y AI Overviews:
| Factor | Correlación con menciones en IA |
|---|---|
| Menciones en YouTube | ~0,737 |
| Menciones de marca en la web | 0,656-0,709 |
| Anchors de marca | 0,511-0,628 |
| Volumen de búsqueda de marca | 0,352-0,466 |
| Domain Rating | 0,266-0,326 |
| Volumen de contenido (número de páginas del sitio) | ~0,194 (“almost no relationship”) |
Esto es correlación, no causalidad. Abrir un canal de YouTube no hará que ChatGPT te cite; la lectura más probable es que tanto las menciones en YouTube como las menciones en IA midan la misma notoriedad de marca subyacente. No vamos a prometerte otra cosa, y nadie más debería. Para dimensionar a qué velocidad crecen estas superficies, mira nuestra nota sobre la adopción de la búsqueda con IA.
¿Cuándo pagar una herramienta y qué exigirle?
El umbral es aritmético: prompts × repeticiones × plataformas ÷ el tiempo disponible de una persona. Por debajo, gana la hoja de cálculo. Por encima, compra — pero interroga antes al vendor:
- ¿Mide el producto real o la API? (Acuérdate del 24%.)
- ¿Reporta intervalos de confianza o solo un número?
- ¿Declara el tamaño de muestra?
- ¿Cuál es la frecuencia de remuestreo y está fijada de antemano?
Si un proveedor te entrega un share of voice sin barra de error, te está vendiendo ruido con un decimal.
¿Qué hacer esta semana en una pyme?
Elige tus 30-50 preguntas, decide el número de repeticiones antes de mirar ningún resultado, ejecútalas sin sesión iniciada en ChatGPT, Perplexity y Google, y registra por separado mención y cita. Después repite la misma muestra fija cada mes y compara intervalos, no puntos. Todo lo que se mueva menos de 5-7 puntos es meteorología, no clima.
Si prefieres que te construyan y te defiendan ese baseline, es justo lo que hace nuestro servicio de visibilidad en IA — y nuestro método etiqueta cada número como medido, calculado o supuesto, para que siempre sepas cuál es cuál.
Preguntas frecuentes
¿Cuántas veces tengo que repetir la misma consulta para medir bien la visibilidad en IA?
Depende de la plataforma y de la métrica, y hay cifras publicadas. Según el paper de Ronald Sielinski (arXiv:2603.08924, junio de 2026), un intervalo de confianza del 95% que abarque unos cinco puntos porcentuales sobre la cuota de citas, es decir, un margen de aproximadamente ±2,5 puntos, exige unas 40-50 consultas en Google Gemini, unas 100 en Perplexity y 150 o más en OpenAI SearchGPT. Para la prevalencia de citas con intervalos de quince puntos de ancho, SearchGPT necesita 60-80 consultas, mientras que Gemini y Perplexity piden casi el doble, alrededor de 140-150. El motivo es que repetir la misma consulta devuelve fuentes mayormente distintas: el solapamiento mediano a nivel de dominio entre dos pasadas idénticas es de solo 0,29-0,31 en Gemini y de 0,50 en Perplexity. Una sola medición no es una medición. Es una muestra de una distribución.
¿Por qué la misma pregunta da respuestas distintas en ChatGPT si pongo la temperatura a cero?
Porque la temperatura solo controla el muestreo de tokens, no el resto del sistema. Thinking Machines Lab demostró en septiembre de 2025 que muestrear 1.000 respuestas a temperatura 0 con el mismo prompt producía 80 respuestas únicas. La causa raíz que identifican no es la temperatura sino la falta de invariancia al tamaño de lote: la carga del servidor varía de forma impredecible y cambia el orden de acumulación en coma flotante. La propia documentación de OpenAI solo promete salidas mayormente deterministas aunque fijes el parámetro seed. Y un estudio académico (arXiv:2408.04667) confirmó que con temperature=0, top-p=1 y semilla fija ninguno de los cinco modelos probados mantuvo el 100% de consistencia. La variabilidad no se elimina. Se mide.
¿Puedo medir mi visibilidad en ChatGPT usando la API de OpenAI?
Puedes, pero no estarás midiendo lo que ven tus clientes. Surfer SEO publicó en febrero de 2026 que solo un 24% de las marcas coincide entre las respuestas de la API y las respuestas de ChatGPT extraídas por scraping, y que en las fuentes citadas el solapamiento cae al 4%. Las diferencias estructurales lo explican: la API promedia 406 palabras frente a 743 de la interfaz, alrededor del 23% de las llamadas a la API no dispara búsqueda web mientras que la interfaz siempre lo hace, y en torno al 25% no devuelve ninguna fuente. Ese estudio no publica versiones de modelo ni la configuración de búsqueda web, así que tómalo como orientativo y no como preciso. La dirección sigue siendo coherente: el producto real lleva capas como la búsqueda, los prompts de sistema y la personalización que la API no reproduce.
¿Qué métricas debo seguir: menciones, citas, posición o sentimiento?
Primero distingue una mención de una cita. Una mención es la IA escribiendo tu nombre. Una cita es la IA enlazándote como fuente. Son cosas distintas y se optimizan distinto. La literatura formaliza tres métricas de citas (Sielinski, 2026): el recuento de citas, que no es comparable entre plataformas; la cuota de citas, tu fracción del total, que sí lo es; y la prevalencia de citas, la fracción de respuestas donde apareces al menos una vez. El paper académico de GEO presentado en KDD 2024 añade la prominencia dentro de la respuesta con Position-Adjusted Word Count y Subjective Impression, que cubre siete dimensiones incluidas relevancia, influencia y probabilidad de clic. El sentimiento es una capa aparte: no cambia tu cuota, cambia lo que vale cada aparición. Para una pyme, empezar por prevalencia y cuota es suficiente.
¿Puedo montar un baseline gratis o necesito pagar una herramienta?
Puedes empezar gratis, y para muchas pymes esa es la opción sensata. El método: fija un conjunto de 30-50 preguntas reales con intención de compra que hagan tus clientes, decide de antemano cuántas repeticiones vas a ejecutar, lánzalas en ChatGPT, Perplexity y Google, y registra en una hoja de cálculo si apareces, en qué posición y junto a qué competidores. Dos advertencias con evidencia detrás. La primera: no uses la regla de repetir hasta que el número se estabilice y entonces parar. Sielinski demuestra que en SearchGPT el ancho del intervalo se estrecha y se vuelve a ensanchar, así que quien para en un punto favorable se está engañando. La segunda: ejecuta sin sesión iniciada para que la personalización no contamine la muestra. Pagas una herramienta cuando prompts por repeticiones por plataformas deja de caber en el tiempo de una persona, no antes.
¿Cuánto cuesta muestrear por API y cada cuánto conviene volver a medir?
Los precios oficiales de OpenAI (consultados el 16 de julio de 2026) permiten calcularlo: gpt-5.4-mini cuesta 0,75 dólares por millón de tokens de entrada y 4,50 por millón de salida, y gpt-5.4-nano cuesta 0,20 y 1,25. El coste dominante no son los tokens sino la herramienta de búsqueda web, facturada aparte a 10 dólares por cada 1.000 llamadas más los tokens del contenido recuperado. Así, un baseline de 50 prompts con 30 repeticiones, es decir 1.500 llamadas con búsqueda activada, se queda en decenas de dólares y no en miles, pero recuerda que mide la API y no el producto real. Sobre la frecuencia: el estudio de referencia muestra volatilidad de un día para otro e incluso a intervalos de diez minutos, así que volver a muestrear a diario sin intervalos de confianza solo produce ruido con aspecto de tendencia. Para una pyme, un ciclo mensual con un tamaño de muestra fijo, comparado por intervalos y no por punto, es defendible. Semanal solo si tu sector se mueve rápido.