GuideDi 4 min di lettura

Il tuo sito blocca ChatGPT senza saperlo? Guida ai crawler AI

GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot: cosa fa ogni crawler AI, come impostare il robots.txt e cosa cambia con le nuove regole di Cloudflare.

Copertina: Il tuo sito blocca ChatGPT senza saperlo? Guida ai crawler AI

In breve

ChatGPT, Claude e Perplexity possono citarti solo se i loro crawler di ricerca leggono il tuo sito. Puoi bloccare l'addestramento dei modelli e restare citabile, ma devi distinguere i crawler giusti nel robots.txt e controllare anche CDN e firewall, a partire dalle nuove impostazioni di Cloudflare del 15 settembre 2026.

  • Ogni fornitore AI usa crawler diversi per la ricerca, per l'addestramento e per le richieste degli utenti.
  • Bloccare GPTBot o ClaudeBot ferma l'addestramento; bloccare OAI-SearchBot o Claude-SearchBot ti toglie dalle risposte.
  • Dal 15 settembre 2026 Cloudflare blocca per impostazione predefinita Training e Agent sulle pagine con pubblicità dei nuovi domini.
  • Il controllo richiede dieci minuti: robots.txt, impostazioni del CDN, contenuti nell'HTML e log del server.

Scritto dall'agente AI di Geosnap, rivisto e approvato da Rinald Sefa.

Se ChatGPT, Claude o Perplexity non citano mai il tuo sito, la causa può essere più banale di quanto pensi: una regola nel file robots.txt, un'impostazione del CDN o un firewall che tiene fuori i loro crawler. Nessuno se ne accorge, perché le persone continuano a vedere il sito normalmente. In questa guida vediamo quali crawler AI esistono, cosa fa ciascuno, come decidere chi lasciare entrare e cosa è cambiato con le nuove impostazioni di Cloudflare.

Perché il robots.txt conta per farti citare dall'AI

Gli assistenti AI possono citare solo le pagine che riescono a leggere. Prima di rispondere a una domanda, ChatGPT, Claude e Perplexity cercano sul web con i propri crawler: se il tuo sito li blocca, nelle risposte comparirà qualcun altro.

Il robots.txt è il file, nella radice del sito, in cui dici ai crawler cosa possono visitare. I crawler AI dei principali fornitori dichiarano di rispettarlo, quindi una singola riga Disallow basta a farti sparire dalle loro ricerche. Il problema è che molte di queste righe sono state aggiunte negli ultimi anni per bloccare l'addestramento dei modelli, senza distinguere tra chi raccoglie dati per addestrare e chi cerca fonti da citare.

Quali crawler AI esistono e cosa fanno

Ogni fornitore usa più crawler con scopi diversi. Questi sono quelli documentati ufficialmente:

FornitoreUser agentA cosa serveRispetta il robots.txt
OpenAIOAI-SearchBotTrovare i siti da mostrare nella ricerca di ChatGPTSì
OpenAIGPTBotRaccogliere contenuti per addestrare i modelliSì
OpenAIChatGPT-UserVisitare una pagina quando lo chiede un utenteNon sempre
AnthropicClaude-SearchBotIndicizzare i contenuti per le ricerche di ClaudeSì
AnthropicClaudeBotRaccogliere contenuti per l'addestramentoSì
AnthropicClaude-UserLeggere una pagina su richiesta di un utenteSì
PerplexityPerplexityBotMostrare e linkare i siti nei risultati di PerplexitySì
PerplexityPerplexity-UserVisitare una pagina su richiesta di un utenteIn genere no
GoogleGoogle-ExtendedUso dei contenuti per addestrare Gemini e per il groundingSì

OpenAI spiega che i siti che bloccano OAI-SearchBot non vengono mostrati nelle risposte della ricerca di ChatGPT, al massimo come link di navigazione. Perplexity precisa che Perplexity-User in genere ignora il robots.txt, perché la visita è richiesta da una persona. Google, invece, chiarisce che Google-Extended non influisce sull'inclusione nella Ricerca Google né sul posizionamento.

Ricerca e addestramento si possono separare

Sì: puoi impedire che i tuoi contenuti vengano usati per addestrare i modelli e restare comunque citabile. OpenAI lo dice esplicitamente: ogni impostazione è indipendente dalle altre, quindi puoi permettere OAI-SearchBot e bloccare GPTBot. Lo stesso vale per i crawler di Anthropic: secondo la documentazione di Claude, bloccare ClaudeBot esclude i contenuti futuri dall'addestramento, mentre bloccare Claude-SearchBot può ridurre la tua visibilità nei risultati.

Un robots.txt che vuole restare visibile nelle risposte senza contribuire all'addestramento può essere simile a questo:

User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

È una scelta, non una regola: molti brand preferiscono lasciare aperto anche l'addestramento, perché i modelli imparano a conoscere il marchio. L'importante è che sia una decisione presa consapevolmente, non un effetto collaterale.

Cloudflare: cosa è cambiato il 15 settembre 2026

Se il tuo sito passa da Cloudflare, controlla le impostazioni dei bot: le regole del CDN valgono anche quando il robots.txt è aperto. A luglio 2026 Cloudflare ha diviso i crawler AI in tre categorie: Search (indicizzazione per i risultati di ricerca), Agent (azioni automatiche per conto degli utenti) e Training (raccolta di dati per i modelli).

Dal 15 settembre 2026, per i nuovi domini, Training e Agent sono bloccati per impostazione predefinita sulle pagine che mostrano pubblicità, mentre Search resta consentito. Lo stesso giorno Cloudflare ha aggiornato il trattamento dei crawler a uso misto, come quelli di Google, Apple e Microsoft che servono sia la ricerca sia l'addestramento: i blocchi ora si applicano anche a loro. In pratica, un'impostazione troppo severa può togliere un sito anche dai risultati di ricerca classici.

Come controllare il tuo sito in 10 minuti

  1. Apri il robots.txt aggiungendo /robots.txt all'indirizzo del tuo sito. Cerca le righe Disallow sotto gli user agent della tabella e una eventuale regola User-agent: * con Disallow: /, spesso dimenticata dopo un rifacimento del sito.
  2. Controlla CDN e firewall. Su Cloudflare guarda le impostazioni dei bot AI nella sezione Sicurezza del dominio; su altri servizi cerca regole che bloccano user agent o intervalli di indirizzi IP. Anthropic avverte che bloccare gli indirizzi IP può impedire ai crawler di leggere il robots.txt, con effetti difficili da prevedere.
  3. Verifica che i contenuti siano nell'HTML. Uno studio di Vercel di dicembre 2024 ha rilevato che i principali crawler AI non eseguono JavaScript: se servizi, prezzi e recensioni compaiono solo dopo il caricamento della pagina, per loro non esistono.
  4. Guarda i log del server per capire quali crawler visitano davvero il sito e quali pagine ricevono errori.
  5. Dai tempo alle modifiche. OpenAI indica che servono circa 24 ore perché un aggiornamento del robots.txt venga recepito dai suoi sistemi.

Nell'analisi tecnica di Geosnap questi controlli sono automatici: il robots.txt viene letto per ogni crawler AI e gli errori che bloccano i bot compaiono tra le azioni da fare. Per capire da quali siti l'AI prende le informazioni quando non trova le tue, leggi anche da dove prendono le informazioni gli LLM.

Fonti

Domande frequenti

Se blocco GPTBot, il mio sito sparisce da ChatGPT?

No. GPTBot raccoglie contenuti per addestrare i modelli. Per comparire nelle risposte della ricerca di ChatGPT conta OAI-SearchBot: se lo lasci entrare, il sito resta citabile anche con GPTBot bloccato.

Bloccare Google-Extended penalizza il posizionamento su Google?

Secondo Google no: Google-Extended non influisce sull'inclusione nella Ricerca Google né sul posizionamento. Riguarda l'uso dei contenuti per addestrare Gemini e per il grounding.

Quanto tempo serve perché una modifica al robots.txt abbia effetto?

OpenAI indica circa 24 ore per i suoi sistemi. Gli altri fornitori non danno tempi precisi: ricontrolla dopo qualche giorno, anche nei log del server.

Il robots.txt basta per bloccare tutti i crawler AI?

No. I crawler che agiscono su richiesta di un utente, come Perplexity-User, possono non rispettarlo. Per un controllo più rigido servono le regole del CDN o del firewall, da usare con attenzione per non bloccare anche i crawler di ricerca.