9 min de lectureIA

llms.txt expliqué : ce que fait vraiment le fichier des crawlers IA

llms.txt est un fichier Markdown qui liste des pages à lire pour les modèles IA. Ce qu'il fait vraiment, qui le respecte aujourd'hui, et si le publier vaut votre temps.

Marius Voß
DevRel · edge infra
Un fichier llms.txt à la racine dessiné comme une courte liste de lecture organisée, posé à côté des règles imposées par robots.txt pour montrer ce que chaque fichier contrôle réellement

llms.txt est un fichier Markdown que vous publiez à la racine de votre domaine - yourdomain.com/llms.txt - qui liste les pages que vous voudriez le plus voir lues par un modèle IA, chacune avec une description d'une ligne. Jeremy Howard d'Answer.AI a proposé le standard llms.txt en septembre 2024, et la spec actuelle se trouve sur llmstxt.org. C'est toute l'idée : une liste de lecture organisée, pas un règlement.

Voici la partie que la plupart des explications passent sous silence. Rien n'est accordé et rien n'est bloqué, et aucun fournisseur majeur de modèles - ni OpenAI, ni Anthropic, ni Google - ne s'est publiquement engagé à récupérer llms.txt avant de répondre à une question. Quelques outils pour développeurs le lisent bel et bien. Presque rien d'autre ne le fait. Si vous êtes venu ici en vous demandant si GPTBot ou ClaudeBot suivent vos redirections, c'est une question séparée - voir ce que font vraiment les crawlers IA à un lien. Cet article porte sur le fichier llms.txt lui-même : ce qu'il contient vraiment, qui le lit, ce qu'il coûte à maintenir, et si en publier un vaut une après-midi en 2026.

Qu'est-ce que llms.txt, exactement

La spec est assez courte pour se lire en deux minutes. Un fichier valide n'a besoin que d'un seul élément obligatoire : un H1 avec le nom de votre site ou de votre projet. Tout le reste est optionnel mais conventionnel. Un blockquote directement sous le H1 donne un résumé en une phrase. Des paragraphes libres peuvent ajouter du contexte. Viennent ensuite des titres H2, chacun contenant une liste à puces de liens, et chaque lien peut porter deux-points suivis d'une courte note sur ce qu'il contient. Une section intitulée "Optional" au niveau H2 est une convention pour le contenu secondaire qu'un modèle peut ignorer quand il travaille avec un contexte limité.

Le format a été construit pour un problème précis : un site de documentation est surtout composé d'éléments de navigation et de liens de barre latérale, et un modèle qui lit le HTML brut brûle des tokens sur tout cela. Un fichier llms.txt lui fournit à la place un index propre. C'est un travail plus étroit que ce que la plupart des articles laissent entendre : le format a été conçu pour la documentation, pas pour le web ouvert. Comparez-le au vrai travail d'optimisation pour moteurs de réponse et cette distinction constitue l'essentiel de la réponse.

llms.txt n'est pas robots.txt

La comparaison à laquelle tout le monde recourt est robots.txt, et cette comparaison induit plus en erreur qu'elle n'aide.

robots.txt est limité par la RFC 9309 à un seul hôte, et il fonctionne parce que les crawlers nommés - Googlebot, Bingbot, les crawlers IA parmi eux - le vérifient avant de récupérer quoi que ce soit et respectent une ligne Disallow par convention vieille de plusieurs décennies. Il n'a jamais accordé d'accès non plus - un agent qui l'ignore allait de toute façon l'ignorer - mais les crawlers qui méritent qu'on s'en inquiète le lisent bel et bien.

Ce soutien n'existe pas pour llms.txt. Rien n'indique à un modèle de vérifier /llms.txt avant de répondre à une question sur votre site. Une poignée d'outils pour développeurs le vérifient bien. Un assistant généraliste qui répond à une question dans une fenêtre de chat n'a aucune obligation de chercher votre fichier, et la plupart ne s'en donnent pas la peine. L'appeler "le fichier des crawlers IA" ou "le robots.txt de l'IA" - les deux étiquettes apparaissent dans presque toutes les explications - implique un mécanisme d'application que le format n'a tout simplement pas. Il ne l'a jamais eu.

robots.txt comme une règle imposée que les crawlers nommés respectent depuis des décennies, à côté de llms.txt comme une liste de lecture consultative que personne ne respecte par défaut

Qui lit vraiment le fichier

L'adoption est réelle. Elle est simplement plus étroite que ce que les articles laissent entendre.

Mintlify a ajouté la génération automatique de llms.txt pour tous les sites qu'elle héberge fin 2024, et l'adoption a bondi du jour au lendemain, parce qu'Anthropic, Cursor, Stripe, Cloudflare et Vercel publient tous leur documentation via des plateformes comme Mintlify, Fern ou GitBook qui génèrent désormais le fichier par défaut. Les outils de codage - Cursor, Windsurf, Claude Code, GitHub Copilot, Cline, Aider - cherchent bien /llms.txt lorsqu'on les pointe vers un site de documentation, parce qu'un index propre bat le scraping de la navigation rendue pour cette tâche précise.

Ce qui ne s'est pas produit, c'est la partie que la plupart des articles sous-entendent. Aucun assistant grand public généraliste n'a confirmé qu'il vérifie le fichier avant de répondre à une question, et les personnes les plus proches de la recherche sont directes à ce sujet. John Mueller de Google l'a dit sans détour : aucun des services IA n'a déclaré l'utiliser, et les journaux serveur montrent que la plupart ne le demandent même pas. Il l'a comparé à la balise meta keywords - un champ que les éditeurs remplissaient autrefois avec sérieux jusqu'à ce que les moteurs de recherche cessent discrètement de le lire, parce qu'il était trivial à manipuler.

Donc : un vrai public parmi les outils de codage et les plateformes de documentation, aucun public confirmé parmi ChatGPT, Gemini ou Perplexity répondant à une question d'achat ou de recherche. Si le trafic IA vers votre site compte assez pour agir dessus, ne l'inférez pas d'un fichier dont personne n'a confirmé la lecture - mesurez-le. Le canal Assistant IA de GA4 est l'endroit où ce trafic apparaît réellement, les jours où il apparaît, et les analytics d'Elido montrent quelles visites proviennent d'un assistant sur les liens que vous publiez vous-même.

À quoi ressemble le fichier, ligne par ligne

Voici un exemple minimal et valide, proche du modèle de la spec :

# Acme Docs

> Acme is an API for parsing invoices. This file lists the pages worth reading first.

Full documentation lives at docs.example.com. Sections below are ordered by how often a new integration needs them.

- [Quickstart](https://docs.example.com/quickstart): Authentication and your first API call
- [Rate limits](https://docs.example.com/limits): Current limits and how to request an increase
- [Endpoints](https://docs.example.com/api): Full request and response schemas

Chaque ligne fait un travail précis. Le H1 est obligatoire ; sauter le blockquote laisse un modèle deviner ce que fait le site avant même d'ouvrir un seul lien. Un vrai fichier regroupe les liens sous des H2 par objectif, pas par navigation du site, ce qui est généralement l'inverse de la façon dont un menu principal est organisé (l'exemple simplifié ci-dessus utilise un seul groupe pour rester court). Les deux-points suivis d'une description après un lien constituent la vraie valeur - l'argument d'une ligne qui décide si un modèle disposant d'une place limitée récupère cette URL ou la saute. La spec autorise aussi un H2 intitulé "Optional" pour exactement ce même contenu secondaire.

llms-full.txt est un animal différent

llms.txt, c'est un index. llms-full.txt intègre le contenu lui-même : les mêmes pages converties en Markdown propre et concaténées en un seul fichier, atteignant parfois des dizaines de milliers de mots, pour qu'un modèle puisse l'ingérer en une seule récupération au lieu de suivre les liens un par un. Les plateformes qui génèrent llms.txt automatiquement - Mintlify, GitBook, Fern - génèrent généralement llms-full.txt en même temps, puisque le pipeline est le même dans les deux cas. Un site de documentation de moins de quelques centaines de pages, c'est raisonnable à garder à jour. Un catalogue de produits s'étendant sur des milliers de pages est trop volumineux pour être utile et trop coûteux à maintenir à jour.

Le coût honnête de sa maintenance

Publier le fichier une fois, c'est une après-midi. Le garder honnête, c'est la partie que personne ne budgétise.

Chaque lien doit encore se résoudre, encore pointer vers la version actuelle de cette page, et encore correspondre à ce qui s'y trouve réellement. Renommez un document ou publiez une nouvelle version d'API, et le fichier se désynchronise discrètement, parce que rien ne casse quand cela arrive. Un llms.txt obsolète ne renvoie pas de 404 - il se contente de nourrir un modèle avec des informations périmées et une confiance totale.

Pour un site de documentation avec une seule équipe, cet entretien est un élément de checklist sur la même revue qui publie les changements de documentation. Pour un site marketing qui publie plusieurs articles par semaine, décider de ce qui appartient à un index organisé devient un travail éditorial à part entière. Posez la question que vous poseriez avant tout autre investissement de contenu : à quoi ressemble le succès, et comment le sauriez-vous ? Ce qui vaut vraiment la peine d'être mesuré dans les analytics de liens applique la même discipline à un canal différent.

Ce qui vous fait vraiment citer aujourd'hui

Mettez le fichier de côté et regardez ce que les preuves soutiennent réellement.

Les directives de robots.txt fonctionnent parce que les crawlers nommés les vérifient avant chaque récupération - OpenAI, Anthropic et Google publient tous quels user agents respectent quelles règles, et la mécanique de tout cela est couverte ici plutôt que répétée dans cet article. Un HTML propre, rapide et sans JavaScript est lu entièrement plutôt que partiellement ; une page qui a besoin d'un rendu côté client pour afficher son contenu peut être abandonnée avant même que votre texte ne se charge, ce qui explique aussi pourquoi l'hygiène des redirections affecte la façon dont une page est traitée, que le lecteur soit une personne ou un modèle. Les données structurées - les schémas Article et FAQPage qui correspondent au texte visible - donnent à un système de récupération un raccourci vers ce que la page prétend, et les propres directives de Google traitent cela comme du SEO technique ordinaire, pas comme une astuce spécifique à l'IA. Être mentionné ailleurs - dans des avis, des forums, les récapitulatifs d'autres personnes - est corrélé à une citation plus forte que presque tout ce qui se trouve sur votre propre domaine, parce que le modèle pèse une réputation construite à travers le web, pas seulement une seule page.

Rien de tout cela n'est un conseil nouveau habillé pour l'instant IA. C'est la même liste que vous donneriez à quelqu'un pour la recherche classique, dirigée vers un système de récupération plutôt qu'un algorithme de classement. llms.txt n'y apparaît nulle part, ce qui est la raison même pour laquelle cet article a commencé par une mise en garde plutôt que par un tutoriel.

Quatre signaux de citation classés par niveau de preuve : les directives robots.txt, le HTML propre et explorable, les données structurées correspondantes, et les mentions hors page, chacun avec l'action à entreprendre

Le verdict : devriez-vous en publier un en 2026

Alors, devriez-vous en publier un ? Cela dépend de quel côté vous vous trouvez.

Si votre documentation repose déjà sur une plateforme qui génère llms.txt gratuitement, il y a peu d'arguments contre. Le public qui le lit - assistants de codage, agents d'IDE, la poignée d'outils sensibles à la documentation construits spécifiquement pour chercher le fichier - est exactement le public que veut un produit destiné aux développeurs, et le coût est proche de zéro parce que le pipeline de quelqu'un d'autre le produit déjà.

Si vous gérez un site marketing, un blog, ou tout ce qu'un acheteur atteint via un assistant généraliste, je repousserais l'idée d'en composer un à la main. L'entretien est réel, le lectorat parmi les assistants qui vous envoient réellement du trafic n'est pas confirmé, et une heure passée à organiser un fichier dont personne n'a prouvé la lecture est une heure non consacrée à des choses avec une vraie trace tangible : des pages explorables, des données structurées qui correspondent à votre contenu, une réputation construite en étant cité ailleurs. Publiez le fichier si c'est gratuit. Ne construisez pas une stratégie de contenu autour.

C'est à peu près là où le cluster ai de ce blog atterrit aussi, à chaque fois : deux minutes d'attention, zéro minute d'anxiété.

Sur le blog

Questions fréquentes

Qu'est-ce que llms.txt ?

llms.txt est un simple fichier Markdown publié à la racine d'un site web - yourdomain.com/llms.txt - qui liste les pages que le propriétaire du site juge les plus utiles à lire pour un modèle IA, chacune avec une courte description. Jeremy Howard d'Answer.AI a proposé le standard llms.txt en septembre 2024, et la spécification actuelle se trouve sur llmstxt.org. Il organise ; il ne restreint ni n'accorde aucun accès.

llms.txt est-il la même chose que robots.txt ?

Non. robots.txt est une convention de contrôle d'accès que les crawlers nommés vérifient avant de récupérer une page, définie par la RFC 9309 et respectée par des décennies de pratique. llms.txt est une liste de lecture consultative sans aucun mécanisme d'application derrière elle - rien n'oblige un modèle à la vérifier, et la plupart ne le font pas.

Les modèles IA comme ChatGPT ou Claude lisent-ils vraiment llms.txt ?

Pour l'essentiel, pas encore. Les outils de codage et les agents d'IDE comme Cursor, Windsurf et GitHub Copilot cherchent bien le fichier lorsqu'on les pointe vers un site de documentation, et des plateformes comme Mintlify le génèrent automatiquement pour la documentation qu'elles hébergent. Aucun assistant grand public généraliste n'a confirmé qu'il vérifie le fichier avant de répondre à une question.

Quelle est la différence entre llms.txt et llms-full.txt ?

llms.txt est un court index de liens avec des descriptions d'une ligne, destiné à orienter un modèle vers les pages les plus utiles d'un site. llms-full.txt est un fichier bien plus volumineux qui intègre le contenu réel des pages sous forme de Markdown propre, concaténé en un seul document qu'un modèle peut ingérer en une seule récupération. Les plateformes qui génèrent l'un génèrent généralement les deux, puisque le pipeline sous-jacent est le même.

llms.txt aide-t-il le SEO ou à être cité par la recherche IA ?

Rien ne prouve que ce soit le cas, et John Mueller de Google l'a directement comparé à la balise meta keywords : un champ que presque personne en dehors de l'éditeur n'a jamais vérifié. Ce qui a des preuves à l'appui, c'est le contenu qui répond d'abord à la question, des données structurées qui correspondent à la page, un HTML propre et explorable, et le fait d'être mentionné sur d'autres sites - et rien de tout cela ne nécessite un fichier llms.txt.

Dois-je ajouter un fichier llms.txt à mon site en 2026 ?

Si votre plateforme de documentation en génère déjà un gratuitement, il n'y a aucune vraie raison de ne pas le garder. Si vous devez le composer et le maintenir vous-même à la main pour un site marketing ou un blog, la réponse honnête est que le lectorat confirmé ne justifie pas actuellement l'effort continu, alors investissez ce temps dans l'explorabilité et la qualité du contenu en premier.

Essayer Elido

Collez une URL, obtenez un lien court

Sans inscription. Lien actif 30 jours. Inscrivez-vous pour le garder pour toujours.

Gratuit, sans inscription · 2 par jour

Essayer Elido

Raccourcisseur d'URL hébergé en UE : domaines personnalisés, analyses approfondies et API ouverte. Forfait gratuit - sans carte bancaire.

Tags
llms.txt
llms.txt file
llms-full.txt
ai crawler file
llms.txt standard
robots.txt

Lire la suite