10 min de lecturaIA

llms.txt explicado: qué hace realmente el archivo de crawlers de IA

llms.txt es un archivo Markdown que enumera páginas para que los modelos de IA las lean. Qué hace realmente, quién lo respeta hoy y si publicar uno vale la pena.

Marius Voß
DevRel · edge infra
Un archivo llms.txt en la raíz del dominio representado como una breve lista de lectura curada, junto a las reglas de cumplimiento obligatorio de robots.txt, para mostrar qué controla realmente cada archivo

llms.txt es un archivo Markdown que publicas en la raíz de tu dominio - tudominio.com/llms.txt - que enumera las páginas que más querrías que un modelo de IA leyera, cada una con una descripción de una línea. Jeremy Howard, de Answer.AI, propuso el estándar llms.txt en septiembre de 2024, y la especificación actual vive en llmstxt.org. Esa es toda la idea: una lista de lectura curada, no un reglamento.

Aquí está la parte que la mayoría de las explicaciones se saltan. No se concede nada y no se bloquea nada, y ningún proveedor de modelos importante - ni OpenAI, ni Anthropic, ni Google - se ha comprometido públicamente a obtener llms.txt antes de responder una pregunta. Unas pocas herramientas para desarrolladores sí lo leen. Casi nada más lo hace. Si llegaste aquí preguntándote si GPTBot o ClaudeBot siguen tus redirecciones, esa es una pregunta distinta - consulta qué hacen realmente los crawlers de IA con un enlace. Esta publicación trata sobre el archivo llms.txt en sí: qué contiene de verdad, quién lo lee, qué cuesta mantenerlo y si publicar uno vale la pena una tarde en 2026.

Qué es llms.txt, exactamente

La especificación es lo bastante breve como para leerla en dos minutos. Un archivo válido necesita exactamente un elemento obligatorio: un H1 con el nombre de tu sitio o proyecto. Todo lo demás es opcional pero convencional. Una cita en bloque justo debajo del H1 da un resumen de una frase. Los párrafos de formato libre pueden añadir contexto. Luego vienen los encabezados H2, cada uno con una lista de enlaces con viñetas, y cada enlace puede llevar dos puntos seguidos de una breve nota sobre lo que contiene. Una sección titulada "Optional" a nivel de H2 es una convención para material secundario que un modelo puede saltarse cuando trabaja con contexto limitado.

El formato se creó para un problema concreto: un sitio de documentación es en su mayor parte navegación y enlaces de barra lateral, y un modelo que lee el HTML en bruto gasta tokens en todo eso. Un archivo llms.txt le entrega en su lugar un índice limpio. Es un trabajo más limitado de lo que sugiere la mayoría de la cobertura: el formato se diseñó para documentación, no para la web abierta. Compáralo con el trabajo real de optimización para motores de respuesta y esa distinción es casi toda la respuesta.

llms.txt no es robots.txt

La comparación a la que todo el mundo recurre es robots.txt, y esa comparación confunde más de lo que ayuda.

robots.txt está delimitado por el RFC 9309 a un único host, y funciona porque los crawlers identificados por nombre - Googlebot, Bingbot, y entre ellos los crawlers de IA - lo comprueban antes de obtener cualquier cosa y respetan una línea Disallow como cuestión de una convención de décadas de antigüedad. Tampoco concedió acceso nunca - un agente que lo ignora siempre lo iba a ignorar -, pero los crawlers que de verdad importan sí lo leen.

Ese respaldo no existe para llms.txt. Nada le dice a un modelo que compruebe /llms.txt antes de responder una pregunta sobre tu sitio. Un puñado de herramientas para desarrolladores sí lo comprueban. Un asistente de propósito general que responde una pregunta en una ventana de chat no tiene ninguna obligación de buscar tu archivo, y la mayoría ni se molesta. Llamarlo "el archivo de los crawlers de IA" o "el robots.txt de la IA" - ambas etiquetas aparecen en casi todas las explicaciones - implica un mecanismo de cumplimiento que el formato simplemente no tiene. Nunca lo tuvo.

robots.txt como una regla de cumplimiento obligatorio que los crawlers identificados por nombre han respetado durante décadas, junto a llms.txt como una lista de lectura orientativa que, por defecto, no respeta nadie

Quién lee realmente el archivo

La adopción es real. Solo que es más limitada de lo que sugiere la cobertura.

Mintlify añadió la generación automática de llms.txt para todos los sitios que aloja a finales de 2024, y la adopción se disparó de la noche a la mañana, porque Anthropic, Cursor, Stripe, Cloudflare y Vercel publican su documentación a través de plataformas como Mintlify, Fern o GitBook que ahora generan el archivo por defecto. Las herramientas de código - Cursor, Windsurf, Claude Code, GitHub Copilot, Cline, Aider - sí buscan /llms.txt cuando se apuntan a un sitio de documentación, porque un índice limpio le gana a raspar la navegación renderizada para esa tarea concreta.

Lo que no ha ocurrido es la parte que la mayoría de las publicaciones dan a entender. Ningún asistente de consumo de propósito general ha confirmado que compruebe el archivo antes de responder una pregunta, y las personas más cercanas a la búsqueda lo dicen sin rodeos. John Mueller, de Google, lo expuso con claridad: ninguno de los servicios de IA ha dicho que lo use, y los registros de servidor muestran que la mayoría ni siquiera lo solicita. Lo comparó con la meta etiqueta keywords - un campo que los editores rellenaban antes con esmero hasta que los motores de búsqueda dejaron de leerlo silenciosamente, porque era trivial de manipular.

En resumen: una audiencia real de herramientas de código y plataformas de documentación, ninguna audiencia confirmada entre ChatGPT, Gemini o Perplexity respondiendo una pregunta de compra o de investigación. Si el tráfico de IA hacia tu sitio te importa lo suficiente como para actuar, no lo infieras a partir de un archivo que nadie ha confirmado que lee - mídelo. El canal AI Assistant de GA4 es donde ese tráfico aparece de verdad, los días en que aparece, y las analíticas de Elido muestran qué visitas vinieron de un asistente en los enlaces que tú mismo publicas.

Cómo es el archivo, línea por línea

Aquí tienes un ejemplo mínimo y válido, cercano al patrón de la especificación:

# Acme Docs

> Acme is an API for parsing invoices. This file lists the pages worth reading first.

Full documentation lives at docs.example.com. Sections below are ordered by how often a new integration needs them.

- [Quickstart](https://docs.example.com/quickstart): Authentication and your first API call
- [Rate limits](https://docs.example.com/limits): Current limits and how to request an increase
- [Endpoints](https://docs.example.com/api): Full request and response schemas

Cada línea cumple una función. El H1 es obligatorio; omitir la cita en bloque deja al modelo adivinando qué hace el sitio antes de abrir un solo enlace. Un archivo real agrupa los enlaces bajo H2 por propósito, no por la navegación del sitio, que suele ser justo lo contrario de cómo se organiza un menú principal (el ejemplo recortado de arriba usa un solo grupo para mantenerlo breve). Los dos puntos y la descripción después de un enlace son el verdadero valor - el argumento de una línea que decide si un modelo con espacio limitado obtiene esa URL o la salta. La especificación también permite un H2 titulado "Optional" para ese mismo tipo de material secundario.

llms-full.txt es un animal distinto

Un índice es lo que es llms.txt. llms-full.txt incrusta el contenido mismo: las mismas páginas convertidas a Markdown limpio y concatenadas en un solo archivo, que a veces llega a decenas de miles de palabras, de modo que un modelo puede ingerirlo en una sola solicitud en lugar de seguir enlaces uno a uno. Las plataformas que generan llms.txt automáticamente - Mintlify, GitBook, Fern - suelen generar también llms-full.txt junto a él, ya que el pipeline es el mismo en ambos casos. Un sitio de documentación de menos de unos pocos cientos de páginas, eso es razonable de mantener actualizado. Un catálogo de productos que llega a miles de páginas es demasiado grande para ser útil y demasiado costoso de mantener al día.

El coste honesto de mantenerlo

Publicar el archivo una vez es cosa de una tarde. Mantenerlo honesto es la parte que nadie presupuesta.

Cada enlace tiene que seguir resolviendo, seguir apuntando a la versión actual de esa página y seguir coincidiendo con lo que realmente hay allí. Renombra un documento o publica una nueva versión de la API, y el archivo se desincroniza silenciosamente, porque nada se rompe cuando eso pasa. Un llms.txt desactualizado no da un 404 - simplemente le da a un modelo información obsoleta con total confianza.

Para un sitio de documentación con un solo equipo, ese mantenimiento es un ítem de la lista de comprobación en la misma revisión que publica los cambios de documentación. Para un sitio de marketing que publica varias entradas por semana, decidir qué pertenece a un índice curado se convierte en un trabajo editorial en sí mismo. Hazte la pregunta que te harías antes de cualquier otra inversión en contenido: ¿cómo se ve el éxito y cómo lo sabrías? Lo que realmente vale la pena medir en las analíticas de enlaces aplica la misma disciplina a un canal distinto.

Qué es lo que realmente te hace ganar citas hoy

Deja el archivo a un lado y mira lo que la evidencia realmente respalda.

Las directivas de robots.txt funcionan porque los crawlers identificados por nombre las comprueban antes de cada solicitud - OpenAI, Anthropic y Google publican todos qué user agents respetan qué reglas, y la mecánica de eso se cubre aquí en lugar de repetirse en esta publicación. El HTML limpio, rápido y sin JavaScript se lee por completo en lugar de a medias; una página que necesita un renderizado del lado del cliente para mostrar su contenido puede ser abandonada antes de que tu texto siquiera cargue, lo cual también explica por qué la higiene de las redirecciones afecta a cómo se trata una página, sea el lector una persona o un modelo. Los datos estructurados - el esquema Article y FAQPage que coincide con el texto visible - le dan a un sistema de recuperación un atajo hacia lo que la página afirma, y las propias directrices de Google tratan esto como SEO técnico ordinario, no como un truco específico para IA. Que te mencionen en otro sitio - en reseñas, foros, recopilaciones de otras personas - se correlaciona con obtener citas con más fuerza que casi cualquier cosa en tu propio dominio, porque el modelo pondera una reputación construida a lo largo de toda la web, no solo una página.

Nada de eso es un consejo nuevo disfrazado para el momento de la IA. Es la misma lista que le darías a alguien para la búsqueda clásica, apuntada a un sistema de recuperación en lugar de a un algoritmo de ranking. llms.txt no aparece en ninguna parte de ella, que es exactamente la razón por la que esta publicación empezó con una advertencia en lugar de con un tutorial.

Cuatro señales de citación ordenadas por evidencia: directivas de robots.txt, HTML limpio y rastreable, datos estructurados coincidentes y menciones fuera de la página, cada una con la acción a tomar

El veredicto: ¿deberías publicar uno en 2026?

Entonces, ¿deberías publicarlo? Depende de qué lado de esto estés.

Si tu documentación ya está en una plataforma que genera llms.txt de forma gratuita, hay pocos argumentos en contra. La audiencia que lo lee - asistentes de código, agentes de IDE, el puñado de herramientas conscientes de la documentación construidas específicamente para buscar el archivo - es exactamente la audiencia que quiere un producto para desarrolladores, y el coste es casi cero porque el pipeline de otro ya lo produce.

Si llevas un sitio de marketing, un blog, o cualquier cosa a la que un comprador llega a través de un asistente de propósito general, yo me lo pensaría antes de construir uno a mano. El mantenimiento es real, la lectoría entre los asistentes que de verdad te envían tráfico está sin confirmar, y una hora dedicada a curar un archivo que nadie ha demostrado que lee es una hora que no se dedica a cosas con un rastro real y verificable: páginas rastreables, datos estructurados que coinciden con tu contenido, una reputación construida a base de que te citen en otros sitios. Publica el archivo si es gratis. No construyas una estrategia de contenido alrededor de él.

Ahí es más o menos donde también acaba aterrizando el cluster de ai de este blog: dos minutos de atención, cero minutos de ansiedad.

Relacionado en el blog

Preguntas frecuentes

¿Qué es llms.txt?

llms.txt es un archivo Markdown sencillo publicado en la raíz de un sitio web - tudominio.com/llms.txt - que enumera las páginas que el propietario del sitio considera más útiles para que un modelo de IA las lea, cada una con una breve descripción. Jeremy Howard, de Answer.AI, propuso el estándar llms.txt en septiembre de 2024, y la especificación actual vive en llmstxt.org. Cura contenido; no restringe ni concede acceso a nada.

¿Es llms.txt lo mismo que robots.txt?

No. robots.txt es una convención de control de acceso que los crawlers identificados por nombre comprueban antes de obtener una página, definida por el RFC 9309 y respetada por décadas de práctica. llms.txt es una lista de lectura orientativa sin ningún mecanismo de cumplimiento detrás - nada obliga a un modelo a comprobarla, y la mayoría no lo hace.

¿Los modelos de IA como ChatGPT o Claude realmente leen llms.txt?

Por ahora, en su mayoría no. Las herramientas de código y los agentes de IDE como Cursor, Windsurf y GitHub Copilot sí buscan el archivo cuando se apuntan a un sitio de documentación, y plataformas como Mintlify lo generan automáticamente para la documentación que alojan. Ningún asistente de consumo de propósito general ha confirmado que compruebe el archivo antes de responder una pregunta.

¿Cuál es la diferencia entre llms.txt y llms-full.txt?

llms.txt es un índice breve de enlaces con descripciones de una línea, pensado para orientar a un modelo hacia las páginas más útiles de un sitio. llms-full.txt es un archivo mucho más grande que incrusta el contenido real de las páginas como Markdown limpio, concatenado en un único documento que un modelo puede ingerir en una sola solicitud. Las plataformas que generan uno suelen generar ambos, ya que el pipeline subyacente es el mismo.

¿llms.txt ayuda con el SEO o a que la IA de búsqueda te cite?

No hay evidencia de que lo haga, y John Mueller, de Google, lo ha comparado directamente con la meta etiqueta keywords: un campo que casi nadie fuera del editor llegó a comprobar nunca. Lo que sí tiene evidencia detrás es el contenido que responde primero a la pregunta, los datos estructurados que coinciden con la página, el HTML limpio y rastreable, y que te mencionen en otros sitios, ninguno de los cuales requiere un archivo llms.txt en absoluto.

¿Debería añadir un archivo llms.txt a mi sitio web en 2026?

Si tu plataforma de documentación ya genera uno de forma gratuita, no hay ningún motivo real para no mantenerlo. Si tuvieras que curarlo y mantenerlo a mano tú mismo para un sitio de marketing o un blog, la respuesta honesta es que la lectoría confirmada no justifica hoy el esfuerzo continuo, así que dedica ese tiempo primero a la rastreabilidad y a la calidad del contenido.

Prueba Elido

Pega una URL, obtén un enlace corto

Sin registro. El enlace vive 30 días. Crea una cuenta para conservarlo.

Gratis, sin registro · 2 por día

Prueba Elido

Acortador de URL alojado en la UE: dominios personalizados, análisis profundo y API abierta. Plan gratuito - sin tarjeta de crédito.

Etiquetas
llms.txt
llms.txt file
llms-full.txt
ai crawler file
llms.txt standard
robots.txt

Seguir leyendo