Qué es llms.txt y sirve de algo: la evidencia de 2026
llms.txt es un índice markdown propuesto para modelos de IA. Google dice que no lo usará y Ahrefs halló que el 97% de los archivos no recibe ni una petición.
llms.txt es un archivo markdown propuesto, servido en la raíz de un sitio, que da a los modelos de lenguaje un índice curado del contenido clave. Jeremy Howard, de Answer.AI, publicó la especificación el 3 de septiembre de 2024. En 2026 ningún gran motor de IA declara soportarlo: Google lo ha rechazado de forma explícita, la documentación de crawlers de OpenAI no lo menciona y Ahrefs encontró que el 97% de los archivos publicados no recibe ninguna petición. Aquí tienes el formato, la evidencia y cuándo sigue mereciendo la pena.
¿Qué es llms.txt y de dónde sale?
llms.txt es una propuesta de Jeremy Howard, cofundador de Answer.AI y fast.ai, publicada el 3 de septiembre de 2024 en llmstxt.org. No es un estándar web ratificado: ningún proveedor de IA está obligado a leerlo y la adopción es del todo voluntaria.
El problema que ataca sí es una restricción real. Los modelos de lenguaje operan dentro de límites de ventana de contexto, y de ahí parte la especificación. La respuesta de Howard es un archivo markdown compacto en /llms.txt, escrito para ayudar a los LLM a usar un sitio web en tiempo de inferencia: un resumen corto más enlaces a las páginas que importan, en un formato dimensionado para esos límites.
La especificación va más allá del archivo único. También propone publicar una versión markdown limpia de cada página en la misma URL con .md añadido (y index.html.md para las URLs sin nombre de archivo). El caso de uso que destaca son los entornos de desarrollo, donde los LLM necesitan acceso rápido a documentación de programación y de APIs.
llms.txt aparece de forma recurrente en las checklists de optimización para motores generativos. Si se ha ganado ese sitio es justo lo que examina esta guía.
¿Cómo es un archivo llms.txt correcto?
El formato es mínimo, según la especificación oficial (septiembre de 2024). Un H1 con el nombre del sitio es la única sección obligatoria. Después, en orden:
- Un blockquote con un resumen breve del sitio.
- Cero o más secciones markdown con contexto que conviene conocer.
- Cero o más listas de archivos, cada una delimitada por un H2, con enlaces en formato
[nombre](url)seguidos opcionalmente de: nota. - Una sección especial llamada “Optional” para material secundario que puede omitirse cuando hace falta un contexto más corto.
Un esqueleto con placeholders queda así:
# Empresa de Ejemplo
> Resumen en una frase de qué hace la empresa y para quién.
Párrafo breve de contexto que un modelo de lenguaje debería conocer.
## Documentación
- [Guía rápida](https://ejemplo.com/docs/guia-rapida.md): instalación y primeros pasos
- [Referencia de la API](https://ejemplo.com/docs/api.md): endpoints y autenticación
## Optional
- [Historia de la empresa](https://ejemplo.com/about.md)
¿En qué se diferencia llms.txt de robots.txt y sitemap.xml?
Hacen trabajos distintos: robots.txt controla el acceso de los rastreadores, sitemap.xml lista URLs para indexación y llms.txt es una guía de contenido curada, sin ninguna capacidad de imponer nada. No bloquea nada y no permite nada.
| Archivo | Qué hace | Soporte oficial hoy |
|---|---|---|
| robots.txt | Permite o bloquea el acceso de los rastreadores | El único mecanismo de control que documenta OpenAI (developers.openai.com/api/docs/bots) |
| sitemap.xml | Lista URLs para descubrimiento e indexación | Estándar consolidado de los buscadores |
| llms.txt | Índice markdown curado para LLM | Ningún gran motor de IA declara leer el archivo (2026) |
| llms-full.txt | Toda la documentación en un solo archivo markdown | Lo autogeneran plataformas como Mintlify |
La documentación oficial de crawlers de OpenAI (consultada en julio de 2026) cubre GPTBot, OAI-SearchBot, OAI-AdsBot y ChatGPT-User, nombra robots.txt como único mecanismo de control y no menciona llms.txt en ningún punto. Si tu objetivo real es gestionar el acceso de los bots de IA, eso es trabajo de robots.txt: lo cubre nuestra guía de crawlers de IA.
llms-full.txt es el hermano maximalista: en vez de un índice, vuelca toda la documentación en un único archivo markdown. Su límite práctico es el tamaño: en sitios grandes puede superar la ventana de contexto de muchos modelos, así que encaja mejor con la ingesta deliberada que con el descubrimiento.
¿Quién publica llms.txt de verdad?
Sobre todo plataformas que lo generan para sus usuarios, no sitios que lo eligieron: el 78,1% de los sitios Shopify publica uno por despliegue automático, frente a un 5,61% de adopción en el top 10.000 en conjunto, según el análisis de HTTP Archive de Casey Burridge (junio de 2026). El caso de uso con señal real en los logs es más estrecho —la documentación técnica— y ahí el archivo también llega muchas veces desde el hosting de docs y no desde el dueño del sitio.
- Anthropic publica uno real: docs.anthropic.com/llms.txt redirige (301) a platform.claude.com/docs/llms.txt, un índice markdown encabezado “Anthropic Developer Documentation” con secciones de enlaces por idioma y categoría (comprobado el 16 de julio de 2026).
- Perplexity sirve docs.perplexity.ai/llms.txt, con un H1 y un blockquote que describe sus APIs.
- Mintlify activó la generación automática de
/llms.txty/llms-full.txtpara todos los sitios de docs que aloja el 20 de noviembre de 2024, citando a Anthropic, Windsurf y Bolt.new. Miles de sitios de documentación tuvieron el archivo de un día para otro.
Fíjate en la asimetría: los laboratorios de IA usan llms.txt para sus propias docs, pero ninguno ha declarado que sus motores consuman el archivo en sitios de terceros. Según el análisis de HTTP Archive de Casey Burridge (junio de 2026), ChatGPT, Claude y Gemini no tienen llms.txt en sus dominios principales, solo en sus docs de desarrollador.
¿Cuántas webs han adoptado llms.txt?
Entre un 5% y un 28% largo, según la muestra que midas. Las cifras de titular divergen porque divergen las metodologías.
Según el dataset de HTTP Archive de Burridge (julio de 2025 a junio de 2026), la adopción en el top 10.000 creció del 1,04% al 5,61% en doce meses: unas 5,4 veces. Desglosado por plataforma, Shopify lidera: el 78,1% de los sitios Shopify publica uno, empujado por el despliegue automático de la plataforma y no por adopción orgánica, mientras que WordPress ronda el 8,7%. Según Ahrefs (logs de mayo de 2026), el 28% de 137.210 dominios con tráfico publica un llms.txt válido: unos 38.000 sitios.
Los agregadores reportan todavía otras cifras: Rankability sitúa la adopción en el 8,7% del top 1.000 mundial (junio de 2026), otro análisis sobre unos 300.000 dominios encontró un 10,13% aproximado y ppc.land reporta un crecimiento de 8,8 veces en doce meses, de 4.088 a 36.120 archivos.
La horquilla es método, no contradicción: distintas muestras de dominios, criterios de validez y fuentes de datos. Dos señales se sostienen en todos los estudios. La adopción crece rápido, y buena parte viene de plataformas: Shopify, Mintlify y Yoast SEO, que genera llms.txt automáticamente como función gratuita de WordPress mientras su propia página de producto evita garantizar que las plataformas de IA lo usen.
¿Google usa llms.txt?
No, y lo ha dicho al menos tres veces, en niveles crecientes de formalidad.
En abril de 2025, John Mueller escribió en Reddit (r/TechSEO), según recoge Search Engine Journal, que ningún servicio de IA ha dicho que use llms.txt, que en los logs de servidor se ve que ni siquiera lo comprueban y que el archivo le recordaba a la meta keywords: el ejemplo clásico de metadato que los buscadores aprendieron a ignorar.
En julio de 2025, Gary Illyes fue más rotundo en el evento Search Central Deep Dive APAC:
“Google doesn’t support LLMs.txt and isn’t planning to” — Gary Illyes (Google), según recoge Search Engine Land, 24 de julio de 2025
Según el mismo reporte, Illyes añadió que el SEO normal basta para aparecer en AI Overviews. Y la documentación oficial de Google Search Central sobre funciones de IA (actualizada el 10 de diciembre de 2025) afirma sin rodeos que no necesitas crear nuevos archivos legibles por máquina, ni archivos de texto para IA, ni markup, para aparecer en esas funciones.
Mueller señaló además un fallo estructural, según la cobertura de Search Engine Journal: un sitio podría mostrar una cosa en llms.txt y otra distinta a usuarios y buscadores. Ese riesgo de cloaking obliga a cualquier bot serio a verificar la página real de todos modos, lo que vuelve redundante el archivo.
¿ChatGPT o Claude leen llms.txt?
Ninguna de las dos empresas lo afirma. La documentación de crawlers de OpenAI nombra robots.txt como único mecanismo y no contiene ninguna declaración de que GPTBot o ChatGPT lean llms.txt. Anthropic publica el archivo para sus propias docs de desarrollador, pero no ha declarado que Claude consuma llms.txt de terceros: una ausencia de afirmación, no una negación.
La única señal positiva vive en los logs de servidor. Dentro de la minoría de peticiones a llms.txt que Ahrefs (mayo de 2026) atribuyó a herramientas de IA, destacaban GPTBot y Claude-Code. Eso apunta a asistentes de código tirando de documentación técnica, no a motores de búsqueda de IA descubriendo webs corrientes.
¿Qué revelan los logs de servidor sobre llms.txt?
Silencio casi total. En el estudio de Ahrefs sobre 137.210 dominios (logs de mayo de 2026), el 97% de los llms.txt publicados no recibió ni una sola petición. La conclusión de la propia Ahrefs: “AI search bots barely fetch these files, and no AI system goes looking for one”.
El tráfico que sí llegó era sobre todo ruido. El 96% de las peticiones venía de bots: herramientas de auditoría SEO (21,7%), bots no identificados (14,9%), crawlers generales (13,1%) y perfiladores tecnológicos tipo BuiltWith (11,6%). Las herramientas de IA supusieron el 19,5% de esos fetches, encabezadas por GPTBot y Claude-Code, pero solo alrededor del 1,1% de las peticiones vino de bots de recuperación de IA: la audiencia teórica del archivo.
En el etiquetado de UpgradePro, eso convierte cualquier beneficio de tráfico por llms.txt en un SUPUESTO, no en un resultado MEDIDO. Nadie ha publicado logs que demuestren lo contrario.
¿Deberías crear un archivo llms.txt?
Créalo si no te cuesta nada; sáltatelo si te roba trabajo real de cosas que sí se leen. La evidencia sostiene una decisión por coste, no por hype.
| Situación | Veredicto |
|---|---|
| Docs de desarrollador, API o producto SaaS | El mejor caso: los asistentes de código (GPTBot, Claude-Code) muestran fetches reales en los logs |
| Docs alojadas en Mintlify | Ya está hecho automáticamente desde noviembre de 2024 |
| Sitio WordPress con Yoast SEO | Activa la función gratuita: coste casi cero, sin tráfico esperable |
| Web de folleto o de servicio local de pyme | Baja prioridad: ningún motor lo lee y no hay docs que indexar |
Decidas lo que decidas, no lo financies con horas que le quitas a trabajo con evidencia detrás. HTML limpio y rastreable, contenido que responde primero y datos estructurados que los sistemas de IA parsean tienen más derecho a tus horas que un archivo que el 97% de las veces nadie pide.
¿Qué hacer esta semana?
Una rutina de 30 minutos, con la evidencia por delante, para un equipo pequeño:
- Revisa tus logs de servidor buscando peticiones a
/llms.txten los últimos 90 días. Mide la demanda antes de invertir: esa es la diferencia entre MEDIDO y SUPUESTO. - En WordPress: activa la generación gratuita de llms.txt de Yoast. El coste es casi cero, así que la evidencia negativa no cambia la decisión.
- En docs con Mintlify: ya sirves
/llms.txty/llms-full.txt; verifica que se rendericen bien. - Si lo escribes a mano: sigue la especificación al pie de la letra — H1, blockquote, listas de enlaces con H2 y una sección “Optional”. Veinte minutos, una sola vez.
- No reasignes presupuesto de rastreabilidad, estructura de contenido o datos estructurados al mantenimiento de llms.txt.
- Revísalo cada trimestre. La adopción creció unas 5,4 veces en un año; si algún motor anuncia soporte, el cálculo cambia, y tus logs lo verán primero.
Y si quieres saber dónde está de verdad tu sitio hoy en las respuestas de IA —medido antes y después, no supuesto—, ese baseline es exactamente lo que entrega nuestra auditoría de visibilidad en IA.
Preguntas frecuentes
¿Qué es exactamente llms.txt?
llms.txt es una propuesta, no un estándar oficial, publicada por Jeremy Howard, cofundador de Answer.AI, el 3 de septiembre de 2024 en llmstxt.org. Es un archivo markdown en la raíz del sitio (/llms.txt) que resume qué es tu web y enlaza a tus páginas clave, en un formato pensado para los modelos de lenguaje y sus límites de ventana de contexto.
¿Google, ChatGPT o Claude leen llms.txt?
No hay evidencia de soporte oficial. Google lo ha negado repetidamente: John Mueller comparó el archivo con la meta keywords en abril de 2025, Gary Illyes dijo en julio de 2025 que Google no lo soporta ni piensa hacerlo, y la documentación de Google Search Central afirma que no necesitas nuevos archivos de texto para IA para aparecer en sus funciones de IA. La documentación de crawlers de OpenAI solo menciona robots.txt, y el estudio de Ahrefs sobre 137.210 dominios encontró que el 97% de los llms.txt publicados no recibió ninguna petición.
¿llms.txt sustituye a robots.txt o al sitemap?
No. robots.txt controla el acceso de los rastreadores y es el único mecanismo de control que nombra la documentación oficial de crawlers de OpenAI, mientras que sitemap.xml lista URLs para indexación. llms.txt es otra cosa: una guía de contenido curada para modelos de lenguaje. No bloquea nada, no permite nada, y hoy ningún gran motor de IA declara usarlo.
¿Vale la pena crear un archivo llms.txt?
Depende del coste y del tipo de sitio. La evidencia dice que casi nadie lo lee, así que no esperes tráfico por tenerlo. El coste, eso sí, es casi cero: Yoast SEO lo genera gratis en WordPress y Mintlify lo crea automáticamente para sitios de documentación. El caso de uso más real es la documentación técnica consumida por asistentes de código: en el estudio de logs de Ahrefs, los pocos fetches de IA que hubo venían sobre todo de GPTBot y Claude-Code. Para una pyme sin docs técnicas es opcional y de baja prioridad.
¿Cómo se escribe un llms.txt correcto?
Siguiendo la especificación: un H1 con el nombre del sitio (la única sección obligatoria), un blockquote con un resumen de una o dos frases, secciones H2 con listas de enlaces donde cada enlace markdown puede llevar una nota breve, y una sección final Optional con lo prescindible. La especificación también sugiere publicar versiones markdown limpias de tus páginas clave en la misma URL con .md añadido. Ejemplos en vivo: las docs de desarrollador de Anthropic y de Perplexity.
¿Qué es llms-full.txt y en qué se diferencia?
llms.txt es un índice curado de enlaces; llms-full.txt vuelca toda la documentación del sitio en un único archivo markdown. Mintlify desplegó ambos automáticamente para todos los sitios de docs que aloja en noviembre de 2024. En sitios grandes, llms-full.txt puede superar la ventana de contexto de muchos modelos, así que funciona mejor para la ingesta deliberada en una herramienta que para el descubrimiento.