9 min de cititAI

llms.txt explicat: ce face de fapt fișierul crawlerelor AI

llms.txt este un fișier Markdown care listează paginile pe care le pot citi modelele AI. Ce face de fapt, cine îl respectă azi și dacă merită efortul să publici unul.

Marius Voß
DevRel · edge infra
Un fișier llms.txt la rădăcina site-ului, desenat ca o listă de lectură scurtă și curatoriată, alături de regulile impuse ale robots.txt, pentru a arăta ce controlează de fapt fiecare fișier

llms.txt este un fișier Markdown pe care îl publici la rădăcina domeniului tău - yourdomain.com/llms.txt - și care listează paginile pe care ți-ai dori cel mai mult ca un model AI să le citească, fiecare cu o descriere de o linie. Jeremy Howard de la Answer.AI a propus standardul llms.txt în septembrie 2024, iar specificația actuală se află pe llmstxt.org. Asta e toată ideea: o listă de lectură curatoriată, nu un regulament.

Iată partea pe care majoritatea explicațiilor o sar. Nimic nu este acordat și nimic nu este blocat, iar niciun furnizor major de modele - nici OpenAI, nici Anthropic, nici Google - nu s-a angajat public să preia llms.txt înainte de a răspunde la o întrebare. Câteva tool-uri pentru dezvoltatori chiar îl citesc. Aproape nimic altceva nu o face. Dacă ai ajuns aici întrebându-te dacă GPTBot sau ClaudeBot urmează redirecționările tale, aceea este o întrebare separată - vezi ce fac de fapt crawlerele AI unui link. Acest articol este despre fișierul llms.txt în sine: ce conține de fapt, cine îl citește, cât costă întreținerea lui și dacă merită o după-amiază în 2026 să publici unul.

Ce este, de fapt, llms.txt

Specificația este suficient de scurtă încât să o citești în două minute. Un fișier valid are nevoie de exact un element obligatoriu: un H1 cu numele site-ului sau proiectului tău. Tot ce urmează este opțional, dar convențional. Un blockquote imediat sub H1 oferă un rezumat de o propoziție. Paragrafele libere pot adăuga context. Apoi urmează titluri H2, fiecare conținând o listă cu marcatori de linkuri, iar fiecare link poate avea două puncte urmate de o scurtă notă despre ce conține. O secțiune numită "Optional" la nivel de H2 este o convenție pentru material secundar pe care un model îl poate sări atunci când lucrează cu context limitat.

Formatul a fost construit pentru o problemă specifică: un site de documentație este în mare parte cadru de navigare și linkuri din sidebar, iar un model care citește HTML-ul brut consumă tokeni pe toate astea. Un fișier llms.txt îi oferă în schimb un index curat. E o sarcină mai restrânsă decât lasă să se înțeleagă majoritatea articolelor: formatul a fost conceput pentru documentație, nu pentru web-ul deschis. Pune-l în balanță cu munca reală de answer engine optimization și distincția asta e cea mai mare parte a răspunsului.

llms.txt nu este robots.txt

Comparația la care ajunge toată lumea este cu robots.txt, iar comparația induce în eroare mai mult decât ajută.

robots.txt este scopat de RFC 9309 la un singur host, și funcționează pentru că crawlerele numite - Googlebot, Bingbot, printre ele și crawlerele AI - îl verifică înainte de a prelua orice și respectă o linie Disallow ca pe o chestiune de convenție veche de zeci de ani. Nici el nu a acordat vreodată acces - un agent care îl ignoră avea oricum de gând să îl ignore - dar crawlerele care merită să te preocupe chiar îl citesc.

Acest sprijin nu există pentru llms.txt. Nimic nu îi spune unui model să verifice /llms.txt înainte de a răspunde la o întrebare despre site-ul tău. Un mic număr de tool-uri pentru dezvoltatori chiar verifică. Un asistent de uz general care răspunde la o întrebare într-o fereastră de chat nu are nicio obligație să caute fișierul tău, iar majoritatea nici nu se obosesc. Numindu-l "fișierul crawlerelor AI" sau "robots.txt pentru AI" - ambele etichete apar în aproape fiecare explicație - se sugerează un mecanism de impunere pe care formatul pur și simplu nu îl are. Nu l-a avut niciodată.

robots.txt ca regulă impusă, respectată de crawlerele numite de zeci de ani, alături de llms.txt ca listă de lectură consultativă, respectată implicit de nimeni

Cine chiar citește fișierul

Adopția este reală. Doar că e mai restrânsă decât lasă de înțeles articolele pe temă.

Mintlify a adăugat generarea automată de llms.txt pentru fiecare site pe care îl găzduiește, la sfârșitul lui 2024, iar adopția a explodat peste noapte, pentru că Anthropic, Cursor, Stripe, Cloudflare și Vercel își publică toate documentația prin platforme precum Mintlify, Fern sau GitBook, care acum generează fișierul implicit. Tool-urile de coding - Cursor, Windsurf, Claude Code, GitHub Copilot, Cline, Aider - chiar caută /llms.txt atunci când sunt îndreptate spre un site de documentație, pentru că un index curat bate extragerea din navigarea randată, pentru acea sarcină anume.

Ce nu s-a întâmplat este partea pe care o lasă de înțeles majoritatea articolelor. Niciun asistent consumer de uz general nu a confirmat că verifică fișierul înainte de a răspunde la o întrebare, iar oamenii cei mai apropiați de căutare sunt tranșanți în privința asta. John Mueller de la Google a spus-o clar: niciunul dintre serviciile AI nu a spus că îl folosește, iar logurile de server arată că majoritatea nici măcar nu îl cer. L-a comparat cu meta tag-ul keywords - un câmp pe care editorii îl completau cândva cu sinceritate, până când motoarele de căutare au încetat discret să îl mai citească, pentru că era trivial de manipulat.

Deci: o audiență reală de tool-uri de coding și platforme de documentație, nicio audiență confirmată printre ChatGPT, Gemini sau Perplexity atunci când răspund la o întrebare de shopping sau de research. Dacă traficul AI către site-ul tău contează suficient de mult cât să acționezi, nu îl deduce dintr-un fișier despre care nimeni nu a confirmat că îl citește - măsoară-l. Canalul AI Assistant din GA4 este locul unde traficul respectiv chiar apare, în zilele în care apare deloc, iar analytics-ul Elido arată care vizite au venit de la un asistent, pe linkurile pe care le publici tu însuți.

Cum arată fișierul, linie cu linie

Iată un exemplu minimal, valid, apropiat de tiparul din specificație:

# Acme Docs

> Acme is an API for parsing invoices. This file lists the pages worth reading first.

Full documentation lives at docs.example.com. Sections below are ordered by how often a new integration needs them.

- [Quickstart](https://docs.example.com/quickstart): Authentication and your first API call
- [Rate limits](https://docs.example.com/limits): Current limits and how to request an increase
- [Endpoints](https://docs.example.com/api): Full request and response schemas

Fiecare linie are un singur rol. H1-ul este obligatoriu; a sări peste blockquote lasă un model să ghicească ce face site-ul înainte să deschidă un singur link. Un fișier real grupează linkurile sub H2-uri după scop, nu după navigarea site-ului, ceea ce de obicei este exact opusul modului în care este organizat un meniu principal (exemplul trunchiat de mai sus folosește un singur grup, ca să rămână scurt). Combinația două-puncte-și-descriere de după un link este valoarea reală - argumentul de o linie care decide dacă un model cu spațiu limitat preia acel URL sau îl sare. Specificația permite și un H2 numit "Optional" pentru exact același tip de material secundar.

llms-full.txt este un animal diferit

Un index e ceea ce este llms.txt. llms-full.txt include chiar conținutul: aceleași pagini convertite în Markdown curat și concatenate într-un singur fișier, ajungând uneori la zeci de mii de cuvinte, astfel încât un model să îl poată ingera dintr-un singur fetch, în loc să urmeze linkurile unul câte unul. Platformele care generează automat llms.txt - Mintlify, GitBook, Fern - generează de obicei și llms-full.txt alături, pentru că pipeline-ul este oricum același. Un site de documentație sub câteva sute de pagini - e rezonabil să îl menții proaspăt. Un catalog de produse care ajunge la mii de pagini este prea mare ca să fie util și prea costisitor de menținut la zi.

Costul onest al întreținerii unuia

Publicarea fișierului o dată e o după-amiază. Menținerea lui onest este partea pentru care nimeni nu bugetează.

Fiecare link trebuie să se rezolve în continuare, să indice în continuare versiunea curentă a paginii respective și să corespundă în continuare cu ce se află acolo de fapt. Redenumești un document sau lansezi o nouă versiune de API, iar fișierul se dezincronizează discret, pentru că nimic nu se strică atunci când se întâmplă asta. Un llms.txt învechit nu dă 404 - pur și simplu hrănește un model cu informații depășite, cu încredere totală.

Pentru un site de documentație cu o singură echipă, această întreținere e un punct pe checklist-ul aceleiași revizuiri care lansează modificările de documentație. Pentru un site de marketing care publică mai multe articole pe săptămână, a decide ce aparține unui index curatoriat devine o muncă editorială în sine. Pune-ți întrebarea pe care ai pune-o înainte de orice altă investiție de conținut: cum arată succesul, și de unde ai ști? Ce chiar merită măsurat în analytics-ul de linkuri aplică aceeași disciplină unui canal diferit.

Ce chiar te face citat azi

Lasă fișierul deoparte și uită-te la ce susțin de fapt dovezile.

Directivele robots.txt funcționează pentru că crawlerele numite le verifică înainte de fiecare fetch - OpenAI, Anthropic și Google publică fiecare ce user agents respectă ce reguli, iar mecanica din spate e acoperită aici, nu repetată în acest articol. HTML-ul curat, rapid, fără JavaScript este citit complet, nu parțial; o pagină care are nevoie de randare pe partea de client pentru a-și arăta conținutul poate fi abandonată înainte ca textul tău să se încarce vreodată, motiv pentru care igiena redirecționărilor afectează cum e tratată o pagină, fie că cititorul este o persoană, fie un model. Datele structurate - schema Article și FAQPage care corespunde textului vizibil - oferă unui sistem de retrieval o scurtătură către ce pretinde pagina, iar recomandările proprii ale Google tratează asta ca SEO tehnic obișnuit, nu ca un truc specific pentru AI. Faptul de a fi menționat în altă parte - în recenzii, forumuri, în roundup-urile altor oameni - se corelează cu a fi citat mai puternic decât aproape orice de pe propriul tău domeniu, pentru că modelul cântărește o reputație construită pe tot web-ul, nu doar pe o singură pagină.

Nimic din toate astea nu e sfat nou, îmbrăcat pentru un moment AI. E aceeași listă pe care i-ai da-o cuiva pentru căutarea clasică, țintită către un sistem de retrieval în loc de un algoritm de ranking. llms.txt nu apare nicăieri în ea, motiv pentru care acest articol s-a deschis cu o avertizare, nu cu un tutorial.

Patru semnale de citare clasate după dovezi: directivele robots.txt, HTML curat și accesibil pentru crawlere, datele structurate care corespund conținutului și mențiunile off-page, fiecare cu acțiunea de urmat

Verdictul: ar trebui să publici unul în 2026

Deci, ar trebui să publici unul? Depinde de care parte a acestei situații te afli.

Dacă documentația ta se află deja pe o platformă care generează gratuit llms.txt, există puține argumente împotrivă. Audiența care îl citește - asistenții de coding, agenții IDE, puținele tool-uri construite special pentru a căuta fișierul - este exact audiența pe care și-o dorește un produs pentru dezvoltatori, iar costul e aproape zero, pentru că pipeline-ul altcuiva îl produce deja.

Dacă administrezi un site de marketing, un blog sau orice la care un cumpărător ajunge printr-un asistent de uz general, aș aștepta înainte să construiesc unul manual. Întreținerea e reală, audiența dintre asistenții care chiar îți trimit trafic e neconfirmată, iar o oră petrecută curatoriind un fișier despre care nimeni nu a dovedit că îl citește e o oră nepetrecută pe lucruri cu un traseu real și verificabil: pagini accesibile pentru crawlere, date structurate care corespund conținutului tău, o reputație construită din a fi citat în altă parte. Publică fișierul dacă e gratuit. Nu-ți construi o strategie de conținut în jurul lui.

Cam acolo ajunge, de altfel, și clusterul ai de pe acest blog: două minute de atenție, zero minute de anxietate.

Alte articole de pe blog

Întrebări frecvente

Ce este llms.txt?

llms.txt este un fișier Markdown simplu, publicat la rădăcina unui site web - yourdomain.com/llms.txt - care listează paginile pe care proprietarul site-ului le consideră cele mai utile pentru citirea de către un model AI, fiecare cu o scurtă descriere. Jeremy Howard de la Answer.AI a propus standardul llms.txt în septembrie 2024, iar specificația actuală se află pe llmstxt.org. Fișierul curatoriază; nu restricționează și nu acordă acces la nimic.

llms.txt este același lucru cu robots.txt?

Nu. robots.txt este o convenție de control al accesului pe care crawlerele numite o verifică înainte de a prelua o pagină, definită de RFC 9309 și respectată printr-o practică veche de zeci de ani. llms.txt este o listă de lectură consultativă, fără niciun mecanism de impunere în spate - nimic nu obligă un model să o verifice, iar majoritatea nici nu o fac.

Modelele AI precum ChatGPT sau Claude chiar citesc llms.txt?

Majoritatea, încă nu. Tool-urile de coding și agenții IDE precum Cursor, Windsurf și GitHub Copilot chiar caută fișierul atunci când sunt îndreptate spre un site de documentație, iar platforme precum Mintlify îl generează automat pentru documentația pe care o găzduiesc. Niciun asistent consumer de uz general nu a confirmat că verifică fișierul înainte de a răspunde la o întrebare.

Care este diferența dintre llms.txt și llms-full.txt?

llms.txt este un index scurt de linkuri cu descrieri de o linie, menit să orienteze un model către cele mai utile pagini ale unui site. llms-full.txt este un fișier mult mai mare, care include chiar conținutul paginilor sub formă de Markdown curat, concatenat într-un singur document pe care un model îl poate ingera dintr-un singur fetch. Platformele care generează unul dintre ele îl generează de obicei pe amândouă, pentru că pipeline-ul din spate este același.

llms.txt ajută la SEO sau la a fi citat de căutarea AI?

Nu există nicio dovadă în acest sens, iar John Mueller de la Google l-a comparat direct cu meta tag-ul keywords: un câmp pe care aproape nimeni în afara editorului nu l-a verificat vreodată. Ce are dovezi în spate este conținutul care răspunde direct la întrebare, datele structurate care corespund paginii, HTML-ul curat și ușor de accesat de crawlere, și faptul de a fi menționat pe alte site-uri - niciunul dintre acestea nu necesită deloc un fișier llms.txt.

Ar trebui să adaug un fișier llms.txt pe site-ul meu în 2026?

Dacă platforma ta de documentație generează deja unul gratuit, nu există niciun motiv real să nu îl păstrezi. Dacă ar trebui să îl curatoriezi și să îl întreții manual pentru un site de marketing sau un blog, răspunsul onest este că audiența confirmată nu justifică în prezent efortul continuu, așa că investește acel timp mai întâi în accesibilitatea pentru crawlere și calitatea conținutului.

Încearcă Elido

Lipește un URL, obții un link scurt funcțional

Fără înregistrare. Linkul este activ timp de 30 de zile. Înregistrează-te ca să-l păstrezi pentru totdeauna.

Gratuit, fără înregistrare · 2 pe zi

Încearcă Elido

Scurtător de URL-uri găzduit în UE, cu domenii personalizate, analiză avansată și un API deschis. Nivel gratuit - fără card bancar.

Etichete
llms.txt
llms.txt file
llms-full.txt
ai crawler file
llms.txt standard
robots.txt

Continuă lectura