9 min di letturaIA

llms.txt spiegato: cosa fa davvero il file dei crawler IA

llms.txt è un file Markdown che elenca le pagine da far leggere ai modelli IA. Cosa fa davvero, chi lo rispetta oggi, e se pubblicarne uno vale il tuo tempo.

Marius Voß
DevRel · edge infra
Un file llms.txt alla radice del dominio disegnato come una breve lista di lettura curata, posto accanto alle regole vincolanti di robots.txt per mostrare cosa controlla davvero ciascun file

llms.txt è un file Markdown che pubblichi alla radice del tuo dominio - tuodominio.com/llms.txt - che elenca le pagine che vorresti di più far leggere a un modello IA, ciascuna con una descrizione di una riga. Jeremy Howard di Answer.AI ha proposto lo standard llms.txt nel settembre 2024, e la specifica attuale si trova su llmstxt.org. Questa è tutta l'idea: una lista di lettura curata, non un regolamento.

Ecco la parte che la maggior parte delle spiegazioni salta. Non viene concesso nulla e non viene bloccato nulla, e nessun grande fornitore di modelli - né OpenAI, né Anthropic, né Google - si è impegnato pubblicamente a recuperare llms.txt prima di rispondere a una domanda. Alcuni strumenti per sviluppatori lo leggono davvero. Quasi nient'altro lo fa. Se sei arrivato qui chiedendoti se GPTBot o ClaudeBot seguono i tuoi redirect, quella è una domanda diversa - vedi cosa fanno davvero i crawler IA a un link. Questo articolo riguarda il file llms.txt in sé: cosa contiene davvero, chi lo legge, quanto costa mantenerlo, e se pubblicarne uno vale un pomeriggio nel 2026.

Cos'è esattamente llms.txt

La specifica è abbastanza breve da poter essere letta in due minuti. Un file valido richiede esattamente un elemento obbligatorio: un H1 con il nome del tuo sito o progetto. Tutto il resto è facoltativo ma convenzionale. Una blockquote subito sotto l'H1 fornisce un riepilogo in una frase. Paragrafi liberi possono aggiungere contesto. Poi vengono le intestazioni H2, ciascuna contenente un elenco puntato di link, e ogni link può portare due punti seguiti da una breve nota su cosa contiene. Una sezione intitolata "Optional" a livello H2 è una convenzione per il materiale secondario che un modello può saltare quando lavora con un contesto limitato.

Il formato è stato costruito per un problema specifico: un sito di documentazione è per lo più chrome di navigazione e link della barra laterale, e un modello che legge l'HTML grezzo consuma token su tutto questo. Un file llms.txt gli fornisce invece un indice pulito. È un compito più circoscritto di quanto la maggior parte della copertura mediatica lasci intendere: il formato è stato progettato per la documentazione, non per il web aperto. Confrontalo con il vero lavoro di answer engine optimization e quella distinzione è la maggior parte della risposta.

llms.txt non è robots.txt

Il confronto a cui tutti ricorrono è robots.txt, e il confronto fuorvia più di quanto aiuti.

robots.txt è delimitato dall'RFC 9309 a un singolo host, e funziona perché i crawler nominati - Googlebot, Bingbot, e tra questi i crawler IA - lo controllano prima di recuperare qualsiasi cosa e rispettano una riga Disallow per una convenzione vecchia di decenni. Non ha mai concesso l'accesso nemmeno lui - un agente che lo ignora era comunque destinato a ignorarlo - ma i crawler di cui vale la pena preoccuparsi lo leggono davvero.

Questo sostegno non esiste per llms.txt. Nulla dice a un modello di controllare /llms.txt prima di rispondere a una domanda sul tuo sito. Una manciata di strumenti per sviluppatori lo controlla davvero. Un assistente general-purpose che risponde a una domanda in una finestra di chat non ha alcun obbligo di cercare il tuo file, e la maggior parte non se ne preoccupa. Chiamarlo "il file dei crawler IA" o "il robots.txt per l'IA" - entrambe le etichette compaiono in quasi ogni spiegazione - implica un meccanismo di applicazione che il formato semplicemente non ha. Non l'ha mai avuto.

robots.txt come regola vincolante che i crawler nominati rispettano da decenni, accanto a llms.txt come lista di lettura consultiva che di default non rispetta nessuno

Chi legge davvero il file

L'adozione è reale. È solo più circoscritta di quanto suggerisca la copertura mediatica.

Mintlify ha aggiunto la generazione automatica di llms.txt per ogni sito che ospita a fine 2024, e l'adozione è esplosa da un giorno all'altro, perché Anthropic, Cursor, Stripe, Cloudflare e Vercel pubblicano tutti la documentazione tramite piattaforme come Mintlify, Fern o GitBook che ora generano il file per impostazione predefinita. Gli strumenti di coding - Cursor, Windsurf, Claude Code, GitHub Copilot, Cline, Aider - cercano davvero /llms.txt quando vengono indirizzati verso un sito di documentazione, perché per quel compito specifico un indice pulito batte lo scraping della navigazione renderizzata.

Quello che non è successo è la parte che la maggior parte degli articoli lascia intendere. Nessun assistente consumer general-purpose ha confermato di controllare il file prima di rispondere a una domanda, e chi è più vicino alla ricerca è schietto al riguardo. John Mueller di Google l'ha detto chiaramente: nessuno dei servizi IA ha dichiarato di usarlo, e i log dei server mostrano che la maggior parte non lo richiede nemmeno. L'ha paragonato al meta tag keywords - un campo che gli editori un tempo compilavano con serietà finché i motori di ricerca non hanno smesso silenziosamente di leggerlo, perché era banale da manipolare.

Quindi: un pubblico reale di strumenti di coding e piattaforme di documentazione, nessun pubblico confermato tra ChatGPT, Gemini o Perplexity quando rispondono a una domanda di shopping o di ricerca. Se il traffico IA verso il tuo sito conta abbastanza da agire di conseguenza, non dedurlo da un file che nessuno ha confermato di leggere - misuralo. Il canale AI Assistant di GA4 è dove quel traffico compare davvero, nei giorni in cui compare, e le analitiche di Elido mostrano quali visite sono arrivate da un assistente sui link che pubblichi tu stesso.

Come appare il file, riga per riga

Ecco un esempio minimo e valido, vicino allo schema della specifica:

# Acme Docs

> Acme is an API for parsing invoices. This file lists the pages worth reading first.

Full documentation lives at docs.example.com. Sections below are ordered by how often a new integration needs them.

- [Quickstart](https://docs.example.com/quickstart): Authentication and your first API call
- [Rate limits](https://docs.example.com/limits): Current limits and how to request an increase
- [Endpoints](https://docs.example.com/api): Full request and response schemas

Ogni riga fa un lavoro preciso. L'H1 è obbligatorio; saltare la blockquote lascia un modello a indovinare cosa fa il sito prima ancora di aprire un solo link. Un file reale raggruppa i link sotto H2 per scopo, non per la navigazione del sito, il che di solito è l'opposto di come è organizzato un menu principale (l'esempio ridotto sopra usa un solo gruppo per restare breve). I due punti seguiti dalla descrizione dopo un link sono il valore vero e proprio - il pitch di una riga che decide se un modello con spazio limitato recupera quell'URL o lo salta. La specifica consente anche un H2 intitolato "Optional" esattamente per lo stesso tipo di materiale secondario.

llms-full.txt è un animale diverso

Un indice è ciò che è llms.txt. llms-full.txt incorpora il contenuto stesso: le stesse pagine convertite in Markdown pulito e concatenate in un unico file, che a volte arriva a decine di migliaia di parole, così un modello può acquisirlo con un solo fetch invece di seguire i link uno alla volta. Le piattaforme che generano llms.txt automaticamente - Mintlify, GitBook, Fern - di solito generano anche llms-full.txt insieme, poiché la pipeline è comunque la stessa. Per un sito di documentazione sotto poche centinaia di pagine, è ragionevole tenerlo aggiornato. Un catalogo prodotti che arriva a migliaia di pagine è troppo grande per essere utile e troppo costoso da mantenere aggiornato.

Il costo onesto di mantenerne uno

Pubblicare il file una volta è questione di un pomeriggio. Mantenerlo onesto è la parte che nessuno mette in conto.

Ogni link deve continuare a risolversi, continuare a puntare alla versione attuale di quella pagina, e continuare a corrispondere a ciò che c'è davvero. Rinomina un documento o pubblica una nuova versione dell'API, e il file si scolla silenziosamente dalla realtà, perché quando succede non si rompe nulla. Un llms.txt obsoleto non restituisce un 404 - fornisce semplicemente a un modello informazioni superate con totale sicurezza.

Per un sito di documentazione con un solo team, questa manutenzione è una voce di checklist nella stessa revisione che pubblica le modifiche alla documentazione. Per un sito marketing che pubblica diversi articoli a settimana, decidere cosa appartiene a un indice curato diventa un lavoro editoriale a sé stante. Fai la domanda che faresti prima di qualsiasi altro investimento sui contenuti: che aspetto ha il successo, e come lo sapresti? Cosa vale davvero la pena misurare nelle analitiche dei link applica la stessa disciplina a un canale diverso.

Cosa ti fa davvero citare oggi

Metti da parte il file e guarda cosa supportano davvero le prove.

Le direttive di robots.txt funzionano perché i crawler nominati le controllano prima di ogni fetch - OpenAI, Anthropic e Google pubblicano tutti quali user agent rispettano quali regole, e la meccanica di questo è trattata qui piuttosto che ripetuta in questo articolo. L'HTML pulito, veloce e privo di JavaScript viene letto per intero invece che parzialmente; una pagina che richiede un rendering lato client per mostrare il proprio contenuto può essere abbandonata prima ancora che il tuo testo venga caricato, il che è anche il motivo per cui l'igiene dei redirect influisce su come viene trattata una pagina, che il lettore sia una persona o un modello. I dati strutturati - schema Article e FAQPage che corrispondono al testo visibile - danno a un sistema di retrieval una scorciatoia verso ciò che la pagina afferma, e le linee guida stesse di Google trattano questo come normale SEO tecnico, non come un trucco specifico per l'IA. Essere menzionati altrove - in recensioni, forum, rassegne di altre persone - è correlato all'essere citati più fortemente di quasi qualsiasi cosa sul proprio dominio, perché il modello pesa una reputazione costruita in tutto il web, non solo su una pagina.

Nessuno di questi è un consiglio nuovo travestito per il momento IA. È la stessa lista che daresti a qualcuno per la ricerca classica, puntata verso un sistema di retrieval invece che verso un algoritmo di ranking. llms.txt non compare da nessuna parte in essa, ed è proprio per questo che l'articolo si è aperto con un avvertimento invece che con un tutorial.

Quattro segnali di citazione classificati per evidenza: direttive robots.txt, HTML pulito e scansionabile, dati strutturati corrispondenti, e menzioni off-page, ciascuno con l'azione da intraprendere

Il verdetto: dovresti pubblicarne uno nel 2026

Allora, dovresti pubblicarne uno? Dipende da quale lato di questa linea ti trovi.

Se la tua documentazione è già su una piattaforma che genera llms.txt gratuitamente, ci sono pochi argomenti contro. Il pubblico che lo legge - assistenti di coding, agenti IDE, la manciata di strumenti consapevoli della documentazione costruiti apposta per cercare il file - è esattamente il pubblico che vuole un prodotto per sviluppatori, e il costo è vicino allo zero perché la pipeline di qualcun altro lo produce già.

Se gestisci un sito marketing, un blog, o qualsiasi cosa a cui un acquirente arriva tramite un assistente general-purpose, io aspetterei prima di crearne uno a mano. La manutenzione è reale, il pubblico tra gli assistenti che effettivamente ti mandano traffico non è confermato, e un'ora spesa a curare un file che nessuno ha dimostrato di leggere è un'ora non spesa su cose con una traccia concreta: pagine scansionabili, dati strutturati che corrispondono al tuo contenuto, una reputazione costruita venendo citati altrove. Pubblica il file se è gratuito. Non costruirci sopra una strategia di contenuti.

È più o meno dove atterra sempre anche il cluster ai di questo blog: due minuti di attenzione, zero minuti di ansia.

Correlati sul Blog

Domande frequenti

Cos'è llms.txt?

llms.txt è un semplice file Markdown pubblicato alla radice di un sito web - tuodominio.com/llms.txt - che elenca le pagine che il proprietario del sito considera più utili da far leggere a un modello IA, ciascuna con una breve descrizione. Jeremy Howard di Answer.AI ha proposto lo standard llms.txt nel settembre 2024, e la specifica attuale si trova su llmstxt.org. Cura una selezione; non limita né concede l'accesso a nulla.

llms.txt è la stessa cosa di robots.txt?

No. robots.txt è una convenzione di controllo degli accessi che i crawler nominati controllano prima di recuperare una pagina, definita dall'RFC 9309 e rispettata da decenni di prassi. llms.txt è una lista di lettura consultiva senza alcun meccanismo di applicazione alle spalle - nulla obbliga un modello a controllarla, e la maggior parte non lo fa.

I modelli IA come ChatGPT o Claude leggono davvero llms.txt?

Per lo più non ancora. Gli strumenti di coding e gli agenti IDE come Cursor, Windsurf e GitHub Copilot cercano effettivamente il file quando vengono indirizzati verso un sito di documentazione, e piattaforme come Mintlify lo generano automaticamente per la documentazione che ospitano. Nessun assistente consumer general-purpose ha confermato di controllare il file prima di rispondere a una domanda.

Qual è la differenza tra llms.txt e llms-full.txt?

llms.txt è un breve indice di link con descrizioni di una riga, pensato per orientare un modello verso le pagine più utili di un sito. llms-full.txt è un file molto più grande che incorpora il contenuto effettivo delle pagine come Markdown pulito, concatenato in un unico documento che un modello può acquisire con un solo fetch. Le piattaforme che ne generano uno tipicamente generano entrambi, poiché la pipeline sottostante è la stessa.

llms.txt aiuta con il SEO o a farsi citare dalla ricerca IA?

Non ci sono prove che lo faccia, e John Mueller di Google l'ha paragonato direttamente al meta tag keywords: un campo che quasi nessuno al di fuori dell'editore ha mai controllato. Ciò che ha prove a suo sostegno è il contenuto answer-first, i dati strutturati che corrispondono alla pagina, l'HTML pulito e scansionabile, ed essere menzionati su altri siti - nessuno dei quali richiede in alcun modo un file llms.txt.

Dovrei aggiungere un file llms.txt al mio sito web nel 2026?

Se la tua piattaforma di documentazione ne genera già uno gratuitamente, non c'è un vero motivo per non tenerlo. Se dovessi curarlo e mantenerlo manualmente per un sito marketing o un blog, la risposta onesta è che il pubblico confermato al momento non giustifica lo sforzo continuo, quindi investi prima quel tempo nella scansionabilità e nella qualità dei contenuti.

Prova Elido

Incolla un URL, ottieni un link breve

Senza registrazione. Il link vive 30 giorni. Iscriviti per conservarlo.

Gratis, nessuna registrazione richiesta · 2 al giorno

Prova Elido

Accorciatore di URL ospitato nell'UE: domini personalizzati, analisi approfondite e API aperta. Piano gratuito - senza carta di credito.

Tag
llms.txt
llms.txt file
llms-full.txt
ai crawler file
llms.txt standard
robots.txt

Continua a leggere