llms.txt e crawler AI: cosa controllate davvero del vostro sito

    Un file proposto come indice per i modelli linguistici, e una serie di regole che decidono chi può leggervi. Cosa serve e cosa no.

    7 minResponsabili sito, marketing, direzione

    Cosa portare a casa

    Risposta breve

    llms.txt è un file di testo, posto alla radice del sito, che elenca in forma ordinata le pagine principali e cosa contengono, pensato per essere letto dai modelli linguistici. È una proposta della comunità, non uno standard adottato: implementarlo costa poco, ma non sostituisce le cose che contano davvero, cioè pagine leggibili senza JavaScript e contenuti che rispondono a domande.

    llms.txt è una proposta, non uno standard: costa poco, ma non è la priorità.

    La priorità resta servire HTML completo: i crawler AI non eseguono JavaScript.

    Bloccare i crawler AI è una scelta legittima, ma ha un costo di visibilità.

    Data Hub

    CONSOO

    Torna alle guide

    Cos'è, in concreto

    È un file di testo semplice, raggiungibile a un indirizzo fisso del sito, che elenca le sezioni e le pagine più importanti con una riga di descrizione ciascuna. L'idea è offrire a un modello un indice curato invece di costringerlo a ricostruire la struttura del sito da solo.

    • Un titolo con il nome dell'azienda e una riga su cosa fa.
    • Sezioni raggruppate per tipo: servizi, guide, prezzi, contatti.
    • Per ogni voce, l'indirizzo completo e una descrizione breve e onesta.
    • Eventualmente una sezione con ciò che è secondario, marcata come tale.

    Serve davvero?

    InterventoImpatto sulla visibilità nelle AICosto
    Servire HTML completo senza JavaScriptDecisivo: senza, il sito è invisibileMedio, dipende da come è fatto il sito
    Rispondere alle domande in modo diretto e citabileMolto altoAlto: è lavoro di contenuto
    Dati strutturati correttiAltoBasso
    Date di pubblicazione e aggiornamento realiMedioMolto basso
    Mappa del sito e struttura chiaraMedioBasso
    File llms.txtIncerto oggi, potenzialmente utile domaniMolto basso

    L'ordine è quello che conta: dedicare attenzione a llms.txt mentre il sito non serve HTML completo significa curare l'indice di un libro con le pagine bianche.

    Detto questo, scriverlo richiede meno di un'ora e non ha controindicazioni. La posizione ragionevole è: fatelo, ma dopo le altre cose, e senza aspettarvi che sia quello a cambiare i risultati.

    Chi può leggere il vostro sito

    Tipo di crawlerCosa faConviene bloccarlo?
    Crawler di ricerca degli assistentiRecupera pagine per rispondere a una domanda dell'utente, con citazioneNo: è il canale da cui arriva visibilità
    Crawler di raccolta per l'addestramentoRaccoglie testo per addestrare modelli, senza citareScelta aziendale legittima in entrambe le direzioni
    Crawler dei motori di ricerca tradizionaliIndicizzazione classicaNo, mai
    Raccoglitori non dichiaratiCopiano contenutiIl blocco dichiarato non li ferma comunque

    La distinzione tra le prime due righe è quella che conta: bloccare tutto indistintamente esclude anche il canale che porta traffico e citazioni. È una decisione da prendere consapevolmente, non copiando un elenco trovato online.

    Cosa fare, in ordine

    1. 01

      Verificare che il sito sia leggibile senza JavaScript

      È il controllo che determina tutto il resto: se il contenuto compare solo dopo l'esecuzione degli script, per i crawler AI la pagina è vuota.

    2. 02

      Decidere quali crawler ammettere

      Una decisione aziendale, presa una volta e scritta nel file dei permessi in modo esplicito, distinguendo ricerca e addestramento.

    3. 03

      Sistemare dati strutturati e date

      Costo basso, effetto concreto su come i contenuti vengono attribuiti e citati.

    4. 04

      Scrivere llms.txt

      Mezz'ora, con selezione onesta delle pagine che contano. Poi aggiornarlo quando cambia qualcosa di rilevante, non a ogni pubblicazione.

    Risorse collegate utili

    Domande frequenti

    Cos'è il file llms.txt?

    Un file di testo alla radice del sito che elenca in forma ordinata le pagine principali con una descrizione ciascuna, pensato per essere letto dai modelli linguistici. È una proposta della comunità, non uno standard adottato dai grandi fornitori.

    Serve davvero averlo?

    Costa meno di un'ora e non ha controindicazioni, quindi si può fare. Ma non è la priorità: se il sito non serve HTML completo senza JavaScript, curare llms.txt equivale a fare l'indice di un libro con le pagine bianche.

    Cosa conta davvero per essere citati dagli assistenti AI?

    Nell'ordine: servire pagine complete senza richiedere JavaScript, rispondere alle domande in modo diretto e citabile, avere dati strutturati corretti e date reali. Il resto viene dopo, llms.txt compreso.

    Conviene bloccare i crawler delle AI?

    Dipende da quali: quelli che recuperano pagine per rispondere a una domanda dell'utente, citando la fonte, sono il canale da cui arriva visibilità e bloccarli è controproducente. Su quelli che raccolgono testo per l'addestramento è una scelta aziendale legittima in entrambe le direzioni.

    Il blocco impedisce davvero l'accesso?

    No: è una richiesta rispettata da chi sceglie di rispettarla, non una barriera tecnica. Se un contenuto non deve essere raccolto da nessuno, la sola soluzione affidabile è non pubblicarlo in una pagina aperta.

    Verifichiamo insieme se il tuo sito è leggibile dai crawler AI: è il controllo che viene prima di tutto il resto.

    CONSOO trasforma idee su software, AI e integrazioni in un percorso tecnico chiaro per PMI.

    • 30 minuti, online
    • Nessun impegno
    • Analisi del tuo caso reale
    • Risposta entro 24 ore