Saltar al contenido

AI Search · Guía

¿Qué es llms.txt y sirve realmente para algo?

llms.txt sirve para algo concreto y más pequeño de lo que se suele contar: es un mapa en texto plano que un agente puede leer cuando busca información en una web. No da ni quita acceso, no indexa nada y ningún gran buscador ni sistema de IA lo documenta como requisito para aparecer.

Esta página responde sólo a esa pregunta, y separa lo que es un hecho, lo que documentan los proveedores, lo que hemos observado, lo que inferimos y lo que es una hipótesis. Cómo se prepara una web entera para buscadores y sistemas de IA está en nuestra guía sobre ese tema.

Por el equipo de VELIA · revisada el

La respuesta corta

Cuatro preguntas y sus respuestas. El resto de la página las desarrolla y dice de dónde sale cada una.

¿Qué es?
llms.txt es una propuesta de 2024, revisada en agosto de 2026, para publicar en una web un fichero en Markdown con su nombre, un resumen y enlaces a las páginas que un agente debería leer.
¿Qué hace?
Ofrece un mapa corto a quien decida leerlo. llms.txt no bloquea ni autoriza a ningún rastreador, no hace que una página se indexe y no vuelve legible un contenido que no lo es.
¿Hace falta para aparecer en buscadores o sistemas de IA?
No. Google documenta que para aparecer en sus funciones de IA no hace falta ningún archivo de texto para IA, y ninguna de las documentaciones de rastreadores que revisamos —Google, OpenAI, Anthropic y Perplexity— dice que lean el de otras webs para elegir fuentes.
¿Qué conviene resolver antes?
Antes de crear un llms.txt, una empresa debería asegurarse de que su web se pueda rastrear, de que su contenido esté en el HTML, de que describa a una sola empresa, de que tenga páginas útiles y de que tenga autoridad fuera de su dominio.

llms.txt es una capa complementaria: no sustituye la rastreabilidad, el HTML semántico, el contenido útil, una entidad clara, la autoridad ni el trabajo de Search.

Qué es exactamente

llms.txt es un fichero de texto en Markdown, en la raíz de una web o en cualquier ruta dentro de ella, con el nombre del sitio, un resumen y listas de enlaces a las páginas que un agente debería leer. Lo propuso Jeremy Howard, de Answer.AI, en septiembre de 2024.

La especificación es corta. Lo único obligatorio es un encabezado de primer nivel con el nombre del sitio. Después, en este orden y todo opcional: un resumen en forma de cita, algunos párrafos de contexto y secciones con listas de enlaces, cada uno con una nota breve. Una sección llamada Optional agrupa lo que un agente puede saltarse si tiene poco espacio.

# Nombre del sitio

> Qué es, en una o dos frases.

Contexto que ayuda a interpretar el resto.

## Páginas

- [Servicios](https://ejemplo.com/servicios): qué ofrece y a quién

## Optional

- [Historia](https://ejemplo.com/historia)

La versión 2, de agosto de 2026, añadió tres cosas: un fichero en una subruta, como /docs/llms.txt, cubre las páginas que cuelgan de ella; cada página puede ofrecer una versión en Markdown en su misma dirección terminada en .md; y dos relaciones de enlace estándar, rel="alternate" y rel="describedby", permiten a un agente encontrar esas versiones y el fichero sin adivinar dónde están.

Qué problema intenta resolver

llms.txt intenta resolver que las páginas web están hechas para personas: un agente que busca información mientras ayuda a alguien tiene que atravesar navegación, anuncios y código para llegar al texto, y cada palabra de más le cuesta tiempo y espacio.

Convertir una página HTML en texto limpio es difícil e impreciso, y la mayoría de las webs no caben enteras en lo que un modelo puede leer de una vez. La propuesta ofrece un atajo: un sitio conocido donde el propio autor de la web explica qué hay y qué leer primero.

Su autor esperaba que sirviera sobre todo en el momento de responder —cuando un agente necesita información mientras atiende a una persona— más que para entrenar modelos, y escribe que así se ha usado. También escribe que donde más se usa es en la documentación de software, que los agentes de programación recorren para acertar con una llamada a una API.

Qué está documentado y qué no

De llms.txt está documentado qué es y cómo se escribe, y se puede comprobar que lo publican hasta los propios laboratorios de IA. No está documentado que ningún buscador ni sistema de IA lea el de otras webs para decidir qué mostrar o qué citar.

Cinco clases de afirmación, separadas. Mezclarlas es la forma más habitual de convertir una propuesta en una promesa.

Hecho
Su propia página la presenta como una propuesta abierta a la comunidad, no como un estándar aprobado. Se publicó en septiembre de 2024 y se revisó en agosto de 2026. robots.txt, en cambio, es un estándar del IETF, el RFC 9309, desde septiembre de 2022.
Documentación del proveedor
Google escribe que no hace falta crear «nuevos archivos legibles por máquina, archivos de texto para IA ni marcado» para aparecer en sus funciones de IA: basta con que la página esté indexada y pueda mostrarse con un fragmento. OpenAI, Anthropic y Perplexity documentan sus rastreadores y cómo controlarlos con robots.txt; ninguna de esas páginas dice que lean el llms.txt de otras webs. Lighthouse, la herramienta de auditoría de Chrome, lo revisa de forma informativa: sólo avisa si el fichero da un error de servidor y, si no existe, lo marca como no aplicable, porque publicarlo es «opcional por ahora».
Observación
OpenAI, Anthropic, Google —en la documentación de la API de Gemini— y Perplexity publican un llms.txt para su propia documentación de desarrolladores. Lo comprobamos el 19 de septiembre de 2026.
Inferencia
Que una empresa publique un llms.txt para su documentación no dice nada de si su buscador lee el de los demás: son dos productos distintos. Lo que sí sugiere es que espera que agentes y asistentes consulten así su documentación, que es el uso que la propuesta describe como principal.
Hipótesis
Que algún sistema de búsqueda generativa lo use, o llegue a usarlo, como señal para elegir fuentes. No conocemos ninguna evidencia pública de que ocurra. Eso no demuestra que no ocurra: demuestra que no se puede contar con ello.

¿Lo usan los buscadores y los sistemas de IA?

Ningún gran buscador ni sistema de IA documenta que use llms.txt para encontrar, elegir o citar fuentes, y Google dice expresamente que no hace falta. Lo que todos documentan es otra cosa: sus rastreadores y robots.txt.

Lo que Google pide para que una página pueda aparecer como enlace en sus respuestas generadas con IA es lo mismo que para la búsqueda normal: que esté indexada y pueda mostrarse con un fragmento. OpenAI, Anthropic y Perplexity distinguen el rastreador que alimenta su búsqueda del que visita una página cuando un usuario lo pide, y documentan cuáles se gobiernan con robots.txt. OpenAI y Perplexity advierten, además, que el que visita una página a petición de un usuario puede no aplicarlo.

Conviene no llevar la conclusión más lejos de lo que da la evidencia. «No está documentado» no significa «sabemos que no lo usan». Significa que nadie puede prometerte que lo usen, y que no tiene sentido dedicarle esfuerzo antes que a lo que sí está documentado.

llms.txt no es robots.txt

robots.txt pide a los rastreadores que no accedan a determinadas partes de una web; llms.txt sugiere qué leer. Uno es un estándar que los grandes rastreadores documentan que respetan. El otro, una propuesta que nadie está obligado a leer.

robots.txt y llms.txt, lado a lado
Aspectorobots.txtllms.txt
Para qué sirvePedir a los rastreadores que no accedan a determinadas rutasDar a un agente un resumen del sitio y un camino de lectura
EstadoEstándar del IETF (RFC 9309, 2022)Propuesta abierta (2024; versión 2 en 2026)
Quién documenta que lo usaGoogle, OpenAI, Anthropic y Perplexity, para sus rastreadoresNinguno de ellos, para su búsqueda o sus respuestas
¿Controla el acceso?Lo pide. El propio estándar dice que no es un mecanismo de autorizaciónNo: no bloquea ni permite nada
Si no existeUn rastreador puede acceder a todoNo ocurre nada; Lighthouse lo marca como no aplicable

La consecuencia práctica: si robots.txt impide el paso a un rastreador, poner esa página en llms.txt no lo abre. Y ninguno de los dos sustituye al sitemap, que lista las direcciones que quieres que un buscador conozca e indexe.

Por qué VELIA mantiene uno

VELIA mantiene un llms.txt porque cuesta poco, porque es la descripción de la empresa escrita una vez y en texto plano, y porque un agente que consulte su web puede leerlo. No porque espere que la haga aparecer en ninguna parte.

Nuestro llms.txt dice qué es VELIA, qué no es, qué capacidades tiene, qué está en producción y qué está en construcción, y enlaza las páginas de esta web. Lo tratamos como una superficie más de la empresa, con la misma regla que el resto de lo que publicamos: ninguna afirmación sin una fuente detrás.

En veliacorp.com

Hecho
Hasta esta versión de la web, el llms.txt de veliacorp.com describía el producto de software que habíamos descontinuado, con su precio y su prueba gratuita, y recogía cuatro afirmaciones que nuestro propio registro tiene como pendientes de verificar. Lo medimos el 19 de septiembre de 2026. Ninguna comprobación automática lo leía: todas miraban páginas HTML.
Decisión
El fichero de esta web describe la empresa actual y pasa las mismas comprobaciones automáticas que una página: no puede nombrar el producto retirado, no puede enlazar páginas congeladas, no puede quedarse atrás del sitemap y no puede publicar una afirmación que no hayamos verificado. No publicamos versiones .md de las páginas: el HTML ya entrega el texto completo sin ejecutar JavaScript, y cada copia más es otra que mantener.
Interpretación
Un llms.txt es otra copia de la identidad de una empresa, escrita para máquinas y que casi nadie de dentro vuelve a leer. Por eso es el sitio donde una descripción antigua sobrevive más tiempo sin que nadie lo note. No tenemos datos de qué sistemas leen el nuestro.

Qué resolver antes de crear uno

Antes de crear un llms.txt hay que resolver todo lo que hace que una web se pueda encontrar y entender sin él. Si eso no está resuelto, el fichero resume una web que las máquinas no pueden leer bien.

  1. Que se pueda rastrear: robots.txt, códigos de respuesta, direcciones canónicas y sitemap dicen lo mismo.
  2. Que el contenido esté en el HTML que entrega el servidor, sin depender de JavaScript.
  3. Que describa a una sola empresa en todas sus superficies, también en las antiguas.
  4. Que tenga páginas que respondan preguntas concretas con evidencia.
  5. Que sus datos estructurados digan lo mismo que el texto visible.
  6. Que tenga autoridad fuera de su propio dominio.

Cada punto está desarrollado en cómo preparar una web para buscadores y sistemas de IA.

Después, si mantenerlo cuesta poco, un llms.txt tiene sentido, sobre todo si publicas documentación que consultan agentes: una API, un producto técnico, un manual. Si lo creas, trátalo como una página más: que diga lo mismo que la web y que algo compruebe que lo sigue diciendo.

En resumen

llms.txt es una idea útil y pequeña. Ayuda a un agente que ya ha llegado a tu web a leerla mejor; no hace que llegue, no decide si te cita y no arregla una web que no se deja leer.

llms.txt es una capa complementaria: no sustituye la rastreabilidad, el HTML semántico, el contenido útil, una entidad clara, la autoridad ni el trabajo de Search.

En VELIA esto forma parte de AI Search & Digital Visibility: preparar la infraestructura digital de un negocio para que pueda ser encontrada y entendida, sin prometer lo que nadie controla.

Hablemos

Nos cuentas cómo trabajáis hoy. Te decimos qué haríamos.

Fuentes

Documentación oficial consultada el . Los proveedores la actualizan; conviene comprobarla antes de tomar una decisión que dependa de ella.

  1. llms.txt: la propuesta (versión 2, agosto de 2026)
  2. llms.txt: qué cambió en la versión 2
  3. IETF, RFC 9309: Robots Exclusion Protocol
  4. Google Search Central: las funciones de IA y tu web
  5. Google Search Central: introducción a robots.txt
  6. Chrome Lighthouse: la comprobación de llms.txt
  7. OpenAI: rastreadores y agentes de usuario
  8. Anthropic: sus rastreadores y cómo bloquearlos
  9. Perplexity: rastreadores de Perplexity