llms.txt Explicado: La Especificación, la Adopción Real y Cómo Publicar

llms.txt promete ofrecer a la IA un mapa limpio de tu sitio. Aquí está lo que realmente requiere la especificación, una lectura honesta sobre si los rastreadores lo usan ya, y cómo publicar uno.

llms.txt es una idea simple que está recibiendo mucha atención: un archivo markdown en la raíz de tu sitio que ofrece a los modelos de lenguaje grande un mapa limpio y curado de lo que ofreces, en lugar de hacerlos luchar para extraer significado de un HTML lleno de anuncios. Vale la pena entenderlo con precisión, porque hay sustancia real en la especificación y promesas exageradas en el marketing alrededor de ella. Esta guía cubre lo que realmente requiere el formato, una lectura honesta sobre si los rastreadores de IA lo respetan hoy, y cómo publicar uno.

Por qué existe el archivo

La propuesta, introducida por Answer.AI en septiembre de 2024, parte de una limitación real: las ventanas de contexto de los LLM son demasiado pequeñas para abarcar la mayoría de los sitios web, y convertir HTML complejo - navegación, anuncios, scripts - en texto limpio es impreciso y con pérdidas. llms.txt evita eso al proporcionar a los modelos información concisa y de nivel experto en un lugar predecible. La palabra clave es inferencia: este archivo está destinado a ayudar a un modelo en el momento en que un usuario le pregunta algo, no para alimentar entrenamientos. Es un resumen curado, escrito a mano, no un volcado de todo.

La especificación, precisamente

El archivo se encuentra en /llms.txt y está escrito en markdown, en un orden de secciones fijo para que pueda ser analizado programáticamente así como leído por un modelo:

Hay una propuesta complementaria: servir una versión markdown limpia de cualquier página en la misma URL con .md añadido (y index.html.md para URLs de directorios), para que un modelo pueda obtener directamente la versión legible. Aquí hay un archivo mínimo y válido:

# QuantumProxies

> Residential, ISP, datacenter, mobile and IPv6 proxies plus SERP, Scraper and
> Extract APIs for web data collection at scale.

Stable API endpoints, per-request rotation, and 200+ country geo-targeting.

## Docs

- [Scraper API](https://quantumproxies.io/scraper-api): Markdown/JSON/HTML output, JS rendering on demand
- [SERP API](https://quantumproxies.io/serp-api): Google, Bing and DuckDuckGo plus verticals

## Guides

- [Feeding LLMs fresh web data](https://quantumproxies.io/blog/feeding-llms-fresh-web-data-2026): grounding and RAG patterns

## Optional

- [All blog posts](https://quantumproxies.io/blog): the full archive, skip for short context
Comparación de robots.txt, sitemap.xml y llms.txt mostrando que cada archivo raíz cumple una función diferente
llms.txt complementa robots.txt y sitemaps - no reemplaza a ninguno. Archivos diferentes, trabajos diferentes.

Cómo difiere de robots.txt y sitemap.xml

Se encuentra junto a los dos archivos que ya conoces, siguiendo la misma convención de ruta raíz. robots.txt establece reglas de acceso - quién puede rastrear qué - y cubrimos eso en nuestra guía de robots.txt. sitemap.xml lista cada página humana indexable para los motores de búsqueda. Ninguno sustituye a llms.txt: un sitemap rara vez enlaza las versiones markdown de las páginas, nunca apunta a recursos externos útiles, y en conjunto es demasiado grande para caber en una ventana de contexto. llms.txt es el resumen curado, del tamaño de un LLM, que esos dos nunca fueron diseñados para ser.

¿Los rastreadores de IA realmente lo respetan? Una respuesta honesta

Aquí es donde la franqueza importa. llms.txt es una propuesta, no un estándar oficial, y la adopción es desigual. A partir de 2025 ningún rastreador de IA importante ha confirmado públicamente que consume llms.txt para clasificar o responder - Google ha dicho claramente que no usa el archivo, y la documentación de Chrome lo describe como 'una convención emergente'. La posición honesta: publicarlo es barato e inofensivo, puede ayudar a herramientas que ingieren documentación (algunos asistentes enfocados en desarrolladores y plataformas de documentación lo usan), y no te cuesta nada prepararte para el futuro. Pero no esperes un aumento en SEO o tráfico de IA. Cualquiera que venda llms.txt como un truco de clasificación está exagerando una propuesta. Trátalo como una higiene de bajo esfuerzo, no como una palanca de crecimiento.

Cómo publicar uno

Escribe el archivo a mano para un sitio pequeño - está destinado a ser curado, y un archivo reflexivo de 30 líneas supera a uno autogenerado de 300 líneas. Para sitios más grandes, existen plugins para VitePress, Docusaurus, Mintlify y Drupal que lo generan a partir de tu contenido, y directorios como llmstxt.site catalogan archivos publicados. La herramienta de referencia, llms_txt2ctx, expande tu archivo en un solo blob de contexto que puedes probar contra modelos reales - produce una versión reducida sin los enlaces Opcionales y una versión completa con ellos:

# Install the reference CLI and expand your file into an LLM context blob
pip install llms-txt

# Lean context (skips the ## Optional links)
llms_txt2ctx llms.txt > llms-ctx.txt

# Full context (includes Optional)
llms_txt2ctx --optional true llms.txt > llms-ctx-full.txt

La trampa de escribir una vez es la obsolescencia. Un llms.txt que apunta a páginas renombradas o eliminadas engaña activamente. Si el tuyo se genera a partir de documentos, conéctalo a tu compilación; si está escrito a mano, revísalo con la misma frecuencia que tu sitemap. Mantener frescas las versiones enlazadas .md es la misma disciplina detrás de cualquier pipeline de grounding - nuestra guía sobre pipelines RAG que no se vuelven obsoletos se aplica directamente.

Diagrama de la estructura de un archivo llms.txt: nombre H1, resumen blockquote, secciones de lista de archivos H2 y una sección opcional
La estructura es fija y pequeña: un H1 requerido, un resumen blockquote, luego listas H2 de enlaces anotados.

Dónde entra en juego el web data limpio

llms.txt trata de publicar un contexto limpio para tu propio sitio. El problema espejo - obtener markdown limpio y listo para LLM de los sitios de los demás para tu propio modelo o agente - es para lo que existe nuestro servicio de web data for LLMs. La Scraper API puede devolver cualquier página como markdown, que es exactamente la forma que tanto un espejo .md de llms.txt como un pipeline de ingestión RAG desean. Si estás construyendo un asistente que necesita leer la web en vivo, esa salida markdown-primero es la pieza que falta; nuestra visión general de alimentar LLMs con datos web frescos lo une todo.

Obtén datos web limpios y listos para LLM

Preguntas frecuentes

¿Qué es llms.txt?

Es un archivo markdown propuesto que se coloca en la raíz de tu sitio (/llms.txt) que proporciona a los modelos de lenguaje grande un resumen conciso y curado de tu contenido y enlaces a versiones detalladas en markdown de las páginas clave. Está destinado a ayudar a los modelos en el momento de la inferencia - cuando un usuario hace una pregunta - más que en el entrenamiento, y solo requiere un nombre H1 como su única sección obligatoria.

¿Los modelos de IA realmente usan llms.txt?

De manera inconsistente. Es una propuesta, no un estándar adoptado; a partir de 2025 ningún rastreador de IA importante ha confirmado su uso para clasificar o responder, y Google ha dicho que no lo hace. Algunos asistentes enfocados en desarrolladores y herramientas de documentación sí lo ingieren. Publicar uno es barato y prepara tu sitio para el futuro, pero trátalo como higiene, no como una palanca probada de tráfico o clasificación.

¿Cómo es llms.txt diferente de robots.txt?

Sirven intenciones opuestas. robots.txt establece reglas de acceso - qué bots pueden rastrear qué rutas - y a menudo se usa para mantener a los rastreadores fuera. llms.txt invita a la IA y le ofrece un mapa curado de qué leer. Siguen la misma convención de ruta raíz y coexisten; llms.txt no reemplaza a robots.txt ni a tu sitemap XML.

¿Cómo creo un archivo llms.txt?

Para un sitio pequeño, escríbelo a mano: un nombre H1, un resumen blockquote, luego secciones H2 que enumeren enlaces anotados en markdown, con una sección ## Opcional para extras que se pueden omitir. Para sitios más grandes, usa un plugin generador para tu plataforma. Pruébalo expandiéndolo con la CLI llms_txt2ctx y haciendo preguntas a un modelo sobre tu contenido.

llms.txt es una idea pequeña y sensata que vale la pena adoptar por lo que es - un archivo de contexto curado - y vale la pena ser escéptico sobre lo que se vende como. Publica uno limpio, mantenlo fresco, y combínalo con datos web genuinamente listos para LLM, y habrás cubierto ambos lados: lo que expones, y lo que consumen tus modelos.

Convierte cualquier página en markdown listo para LLM