9 min leestijdAI

llms.txt uitgelegd: wat het AI-crawlerbestand echt doet

llms.txt is een Markdown-bestand met een lijst pagina's voor AI-modellen om te lezen. Wat het echt doet, wie het vandaag naleeft, en of publiceren de moeite waard is.

Marius Voß
DevRel · edge infra
Een llms.txt-bestand op rootniveau getekend als een korte, samengestelde leeslijst, naast de afgedwongen regels van robots.txt, om te laten zien wat elk bestand daadwerkelijk regelt

llms.txt is een Markdown-bestand dat je publiceert op de root van je domein - jouwdomein.com/llms.txt - met een lijst van de pagina's die je het liefst door een AI-model gelezen zou zien, elk met een beschrijving van één regel. Jeremy Howard van Answer.AI stelde de llms.txt-standaard voor in september 2024, en de huidige spec staat op llmstxt.org. Dat is het hele idee: een samengestelde leeslijst, geen regelboek.

Dit is het deel dat de meeste uitleggers overslaan. Er wordt niets verleend en niets geblokkeerd, en geen enkele grote modelleverancier - niet OpenAI, niet Anthropic, niet Google - heeft publiekelijk toegezegd llms.txt op te halen voordat hij een vraag beantwoordt. Een handvol ontwikkelaarstools leest het wel. Verder vrijwel niemand. Kwam je hier met de vraag of GPTBot of ClaudeBot je redirects volgen, dan is dat een andere vraag - zie wat AI-crawlers daadwerkelijk met een link doen. Dit artikel gaat over het llms.txt-bestand zelf: wat er echt in staat, wie het leest, wat het kost om te onderhouden, en of het de moeite van een middag waard is om er een te publiceren in 2026.

Wat is llms.txt precies

De spec is kort genoeg om in twee minuten te lezen. Een geldig bestand heeft precies één verplicht element nodig: een H1 met je site- of projectnaam. Alles daarna is optioneel maar conventioneel. Een blockquote direct onder de H1 geeft een samenvatting van één zin. Vrije alinea's kunnen context toevoegen. Daarna volgen H2-koppen, elk met een lijst met links, en elke link kan een dubbele punt plus een korte notitie dragen over wat hij bevat. Een sectie met de titel "Optional" op H2-niveau is een conventie voor secundair materiaal dat een model kan overslaan wanneer het met beperkte context werkt.

Het format is gebouwd voor één specifiek probleem: een documentatiesite bestaat grotendeels uit navigatiechrome en sidebar-links, en een model dat de ruwe HTML leest, verbrandt tokens aan dat alles. Een llms.txt-bestand geeft het in plaats daarvan een schone index. Dat is een kleinere taak dan de meeste berichtgeving suggereert: het format is ontworpen voor docs, niet voor het open web. Zet dat naast het eigenlijke werk aan answer engine optimization en dat onderscheid is het grootste deel van het antwoord.

llms.txt is geen robots.txt

De vergelijking waar iedereen naar grijpt is robots.txt, en die vergelijking misleidt meer dan hij helpt.

robots.txt is door RFC 9309 beperkt tot één host, en het werkt omdat met naam genoemde crawlers - Googlebot, Bingbot, de AI-crawlers daaronder - het controleren voordat ze iets ophalen en een Disallow-regel naleven als kwestie van decennia-oude conventie. Het verleende ook nooit toegang - een agent die het negeert, zou het toch altijd hebben genegeerd - maar de crawlers waar het om gaat, lezen het wel.

Die dekking bestaat niet voor llms.txt. Niets zegt een model dat het /llms.txt moet controleren voordat het een vraag over jouw site beantwoordt. Een handvol ontwikkelaarstools controleert het wel. Een assistent voor algemeen gebruik die een vraag beantwoordt in een chatvenster heeft geen verplichting om je bestand op te zoeken, en de meeste doen de moeite niet. Het "het AI-crawlerbestand" of "de robots.txt voor AI" noemen - beide labels duiken op in bijna elke uitleg - suggereert een afdwingingsmechanisme dat het format simpelweg niet heeft. Dat heeft het nooit gehad.

robots.txt als een afgedwongen regel die met naam genoemde crawlers al decennia naleven, naast llms.txt als een adviserende leeslijst die standaard door niemand wordt nageleefd

Wie leest het bestand daadwerkelijk

Adoptie is reëel. Ze is alleen kleiner dan de berichtgeving suggereert.

Mintlify voegde automatische llms.txt-generatie toe voor elke site die het host, eind 2024, en de adoptie schoot van de ene op de andere dag omhoog, omdat Anthropic, Cursor, Stripe, Cloudflare en Vercel allemaal docs publiceren via platforms zoals Mintlify, Fern of GitBook die het bestand nu standaard genereren. Codeertools - Cursor, Windsurf, Claude Code, GitHub Copilot, Cline, Aider - zoeken /llms.txt wel op wanneer ze naar een documentatiesite worden gewezen, omdat een schone index beter is dan het scrapen van gerenderde navigatie voor die ene taak.

Wat niet is gebeurd, is het deel dat de meeste artikelen suggereren. Geen enkele consumentenassistent voor algemeen gebruik heeft bevestigd het bestand te controleren voordat hij een vraag beantwoordt, en de mensen die het dichtst bij zoeken staan zijn daar bot over. Googles John Mueller zei het botweg: geen van de AI-diensten heeft gezegd het te gebruiken, en serverlogs laten zien dat de meeste het niet eens opvragen. Hij vergeleek het met de keywords-metatag - een veld dat uitgevers ooit oprecht invulden totdat zoekmachines het stilletjes niet meer lazen, omdat het triviaal te misbruiken was.

Dus: een reëel publiek van codeertools en docs-platforms, geen bevestigd publiek onder ChatGPT, Gemini of Perplexity als die een winkel- of onderzoeksvraag beantwoorden. Is AI-verkeer naar je site belangrijk genoeg om naar te handelen, leid het dan niet af uit een bestand waarvan niemand bevestigde het te lezen - meet het. GA4's AI Assistant-kanaal is waar dat verkeer daadwerkelijk verschijnt, op de dagen dat het al verschijnt, en Elido's analytics laten zien welke bezoeken van een assistent kwamen op de links die je zelf publiceert.

Hoe het bestand eruitziet, regel voor regel

Hier is een minimaal, geldig voorbeeld, dicht bij het patroon in de spec:

# Acme Docs

> Acme is an API for parsing invoices. This file lists the pages worth reading first.

Full documentation lives at docs.example.com. Sections below are ordered by how often a new integration needs them.

- [Quickstart](https://docs.example.com/quickstart): Authentication and your first API call
- [Rate limits](https://docs.example.com/limits): Current limits and how to request an increase
- [Endpoints](https://docs.example.com/api): Full request and response schemas

Elke regel doet één ding. De H1 is verplicht; de blockquote overslaan laat een model gissen naar wat de site doet voordat het ook maar één link opent. Een echt bestand groepeert links onder H2's per doel, niet per sitenavigatie, wat meestal het tegenovergestelde is van hoe een hoofdmenu is georganiseerd (het ingekorte voorbeeld hierboven gebruikt één groep om het kort te houden). De dubbele punt met beschrijving na een link is de eigenlijke waarde - de pitch van één regel die bepaalt of een model met beperkte ruimte die URL ophaalt of overslaat. De spec staat ook een H2 met de titel "Optional" toe voor precies datzelfde secundaire materiaal.

llms-full.txt is een ander beestje

Een index, dat is wat llms.txt is. llms-full.txt zet de content zelf inline: dezelfde pagina's omgezet naar schone Markdown en samengevoegd tot één bestand, soms oplopend tot tienduizenden woorden, zodat een model het in één keer kan ophalen in plaats van links één voor één te volgen. Platforms die llms.txt automatisch genereren - Mintlify, GitBook, Fern - genereren meestal ook llms-full.txt erbij, omdat de pipeline sowieso dezelfde is. Een docs-site met minder dan een paar honderd pagina's, dat is haalbaar om actueel te houden. Een productcatalogus die oploopt tot duizenden pagina's is te groot om nuttig te zijn en te duur om actueel te houden.

De eerlijke kostprijs van het onderhouden ervan

Het bestand één keer publiceren is een middagje werk. Het eerlijk houden is het deel waar niemand tijd voor inplant.

Elke link moet nog steeds oplossen, nog steeds naar de actuele versie van die pagina wijzen, en nog steeds overeenkomen met wat er echt staat. Hernoem je een doc of breng je een nieuwe API-versie uit, dan raakt het bestand stilletjes uit sync, omdat er niets stukgaat wanneer dat gebeurt. Een verouderde llms.txt geeft geen 404 - hij voedt een model gewoon met verouderde informatie, met volledig vertrouwen.

Voor een docs-site met één team is dat onderhoud een checklist-item in dezelfde review die docwijzigingen uitbrengt. Voor een marketingsite die meerdere keren per week publiceert, wordt beslissen wat in een samengestelde index thuishoort een redactionele klus op zich. Stel de vraag die je bij elke andere contentinvestering zou stellen: hoe ziet succes eruit, en hoe zou je dat weten? Wat het echt waard is om te meten in link-analytics past dezelfde discipline toe op een ander kanaal.

Wat je vandaag daadwerkelijk geciteerd krijgt

Laat het bestand even terzijde en kijk naar wat het bewijs daadwerkelijk ondersteunt.

robots.txt-directieven werken omdat met naam genoemde crawlers ze controleren voor elke fetch - OpenAI, Anthropic en Google publiceren allemaal welke user agents welke regels naleven, en de mechanica daarvan wordt hier behandeld in plaats van herhaald in dit artikel. Schone, snelle, JavaScript-vrije HTML wordt volledig gelezen in plaats van gedeeltelijk; een pagina die een client-side render nodig heeft om zijn content te tonen, kan worden verlaten voordat je tekst ooit laadt, wat ook verklaart waarom redirecthygiëne beïnvloedt hoe een pagina wordt behandeld, of de lezer nu een persoon is of een model. Structured data - Article- en FAQPage-schema dat overeenkomt met de zichtbare tekst - geeft een retrievalsysteem een kortere weg naar wat de pagina beweert, en Googles eigen richtlijnen behandelen dit als gewone technische SEO, geen AI-specifieke truc. Elders vermeld worden - in reviews, forums, andermans overzichtsartikelen - correleert sterker met geciteerd worden dan bijna alles op je eigen domein, omdat het model een reputatie weegt die over het hele web is opgebouwd, niet slechts op één pagina.

Niets daarvan is nieuw advies, verkleed voor een AI-moment. Het is dezelfde lijst die je iemand zou geven voor klassiek zoeken, alleen nu gericht op een retrievalsysteem in plaats van een rankingalgoritme. llms.txt komt er nergens in voor, en dat is precies waarom dit artikel begon met een waarschuwing in plaats van een tutorial.

Vier citatiesignalen gerangschikt op bewijskracht: robots.txt-directieven, schone crawlebare HTML, overeenkomende structured data, en vermeldingen buiten de eigen pagina, elk met de actie die erbij hoort

Het verdict: moet je er in 2026 een publiceren

Dus, moet je er een publiceren? Dat hangt af van aan welke kant je staat.

Staan je docs al op een platform dat gratis llms.txt genereert, dan is er weinig tegenargument. Het publiek dat het leest - codeerassistenten, IDE-agents, het handjevol documentatiebewuste tools die specifiek gebouwd zijn om het bestand op te zoeken - is precies het publiek dat een product voor ontwikkelaars wil, en de kosten liggen dicht bij nul omdat de pipeline van iemand anders het al produceert.

Run je een marketingsite, een blog, of iets waar een shopper via een assistent voor algemeen gebruik binnenkomt, dan zou ik wachten met er zelf een te bouwen. Het onderhoud is reëel, het lezerschap onder de assistenten die je daadwerkelijk verkeer sturen is onbevestigd, en een uur besteed aan het samenstellen van een bestand waarvan niemand bewezen heeft dat het gelezen wordt, is een uur niet besteed aan dingen met een echt bewijsspoor: crawlebare pagina's, structured data die overeenkomt met je content, een reputatie opgebouwd door elders geciteerd te worden. Publiceer het bestand als het gratis is. Bouw er geen contentstrategie omheen.

Dat is ongeveer waar de ai-cluster op deze blog ook steeds op uitkomt: twee minuten aandacht, nul minuten paniek.

Gerelateerd op de blog

Veelgestelde vragen

Wat is llms.txt?

llms.txt is een gewoon Markdown-bestand dat wordt gepubliceerd op de root van een website - jouwdomein.com/llms.txt - met een lijst van de pagina's die de sitehouder het nuttigst vindt voor een AI-model om te lezen, elk met een korte beschrijving. Jeremy Howard van Answer.AI stelde de llms.txt-standaard voor in september 2024, en de huidige specificatie staat op llmstxt.org. Het bestand cureert; het beperkt of verleent geen enkele toegang.

Is llms.txt hetzelfde als robots.txt?

Nee. robots.txt is een toegangscontroleconventie die met naam genoemde crawlers controleren voordat ze een pagina ophalen, vastgelegd in RFC 9309 en nageleefd door decennia aan praktijk. llms.txt is een adviserende leeslijst zonder enig afdwingingsmechanisme erachter - niets verplicht een model om ernaar te kijken, en de meeste doen dat ook niet.

Lezen AI-modellen zoals ChatGPT of Claude llms.txt daadwerkelijk?

Grotendeels nog niet. Codeertools en IDE-agents zoals Cursor, Windsurf en GitHub Copilot zoeken het bestand wel op wanneer ze naar een documentatiesite worden gewezen, en platforms zoals Mintlify genereren het automatisch voor de docs die ze hosten. Geen enkele consumentenassistent voor algemeen gebruik heeft bevestigd het bestand te controleren voordat hij een vraag beantwoordt.

Wat is het verschil tussen llms.txt en llms-full.txt?

llms.txt is een korte index van links met beschrijvingen van één regel, bedoeld om een model te oriënteren op de nuttigste pagina's van een site. llms-full.txt is een veel groter bestand dat de daadwerkelijke paginacontent inline zet als schone Markdown, samengevoegd tot één document dat een model in één keer kan ophalen. Platforms die het ene genereren, genereren meestal ook het andere, omdat de onderliggende pipeline dezelfde is.

Helpt llms.txt bij SEO of bij geciteerd worden door AI-zoekmachines?

Daar is geen bewijs voor, en Googles John Mueller heeft het rechtstreeks vergeleken met de keywords-metatag: een veld dat bijna niemand buiten de uitgever ooit controleerde. Wat wel bewijs achter zich heeft, is content die meteen met het antwoord begint, structured data die overeenkomt met de pagina, schone, crawlebare HTML, en vermeld worden op andere sites - niets daarvan vereist ook maar enig llms.txt-bestand.

Moet ik in 2026 een llms.txt-bestand aan mijn website toevoegen?

Als je documentatieplatform er al gratis een genereert, is er geen echte reden om het niet te houden. Moet je het zelf met de hand samenstellen en onderhouden voor een marketingsite of blog, dan is het eerlijke antwoord dat bevestigd lezerschap de doorlopende inspanning momenteel niet rechtvaardigt, dus stop die tijd eerst in crawlebaarheid en contentkwaliteit.

Probeer Elido

Plak een URL, krijg een werkende korte link

Geen aanmelding nodig. Link blijft 30 dagen actief. Meld je aan om hem voor altijd te bewaren.

Gratis, geen aanmelding nodig · 2 per dag

Probeer Elido

In de EU gehoste URL-shortener met aangepaste domeinen, uitgebreide analyses en een open API. Gratis abonnement - geen creditcard nodig.

Tags
llms.txt
llms.txt file
llms-full.txt
ai crawler file
llms.txt standard
robots.txt

Verder lezen