Il tuo sito blocca ChatGPT senza saperlo? Guida ai crawler AI
GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot: cosa fa ogni crawler AI, come impostare il robots.txt e cosa cambia con le nuove regole di Cloudflare.

In breve
ChatGPT, Claude e Perplexity possono citarti solo se i loro crawler di ricerca leggono il tuo sito. Puoi bloccare l'addestramento dei modelli e restare citabile, ma devi distinguere i crawler giusti nel robots.txt e controllare anche CDN e firewall, a partire dalle nuove impostazioni di Cloudflare del 15 settembre 2026.
- Ogni fornitore AI usa crawler diversi per la ricerca, per l'addestramento e per le richieste degli utenti.
- Bloccare GPTBot o ClaudeBot ferma l'addestramento; bloccare OAI-SearchBot o Claude-SearchBot ti toglie dalle risposte.
- Dal 15 settembre 2026 Cloudflare blocca per impostazione predefinita Training e Agent sulle pagine con pubblicità dei nuovi domini.
- Il controllo richiede dieci minuti: robots.txt, impostazioni del CDN, contenuti nell'HTML e log del server.
Scritto dall'agente AI di Geosnap, rivisto e approvato da Rinald Sefa.
Se ChatGPT, Claude o Perplexity non citano mai il tuo sito, la causa può essere più banale di quanto pensi: una regola nel file robots.txt, un'impostazione del CDN o un firewall che tiene fuori i loro crawler. Nessuno se ne accorge, perché le persone continuano a vedere il sito normalmente. In questa guida vediamo quali crawler AI esistono, cosa fa ciascuno, come decidere chi lasciare entrare e cosa è cambiato con le nuove impostazioni di Cloudflare.
Perché il robots.txt conta per farti citare dall'AI
Gli assistenti AI possono citare solo le pagine che riescono a leggere. Prima di rispondere a una domanda, ChatGPT, Claude e Perplexity cercano sul web con i propri crawler: se il tuo sito li blocca, nelle risposte comparirà qualcun altro.
Il robots.txt è il file, nella radice del sito, in cui dici ai crawler cosa possono visitare. I crawler AI dei principali fornitori dichiarano di rispettarlo, quindi una singola riga Disallow basta a farti sparire dalle loro ricerche. Il problema è che molte di queste righe sono state aggiunte negli ultimi anni per bloccare l'addestramento dei modelli, senza distinguere tra chi raccoglie dati per addestrare e chi cerca fonti da citare.
Quali crawler AI esistono e cosa fanno
Ogni fornitore usa più crawler con scopi diversi. Questi sono quelli documentati ufficialmente:
| Fornitore | User agent | A cosa serve | Rispetta il robots.txt |
|---|---|---|---|
| OpenAI | OAI-SearchBot | Trovare i siti da mostrare nella ricerca di ChatGPT | Sì |
| OpenAI | GPTBot | Raccogliere contenuti per addestrare i modelli | Sì |
| OpenAI | ChatGPT-User | Visitare una pagina quando lo chiede un utente | Non sempre |
| Anthropic | Claude-SearchBot | Indicizzare i contenuti per le ricerche di Claude | Sì |
| Anthropic | ClaudeBot | Raccogliere contenuti per l'addestramento | Sì |
| Anthropic | Claude-User | Leggere una pagina su richiesta di un utente | Sì |
| Perplexity | PerplexityBot | Mostrare e linkare i siti nei risultati di Perplexity | Sì |
| Perplexity | Perplexity-User | Visitare una pagina su richiesta di un utente | In genere no |
Google-Extended | Uso dei contenuti per addestrare Gemini e per il grounding | Sì |
OpenAI spiega che i siti che bloccano OAI-SearchBot non vengono mostrati nelle risposte della ricerca di ChatGPT, al massimo come link di navigazione. Perplexity precisa che Perplexity-User in genere ignora il robots.txt, perché la visita è richiesta da una persona. Google, invece, chiarisce che Google-Extended non influisce sull'inclusione nella Ricerca Google né sul posizionamento.
Ricerca e addestramento si possono separare
Sì: puoi impedire che i tuoi contenuti vengano usati per addestrare i modelli e restare comunque citabile. OpenAI lo dice esplicitamente: ogni impostazione è indipendente dalle altre, quindi puoi permettere OAI-SearchBot e bloccare GPTBot. Lo stesso vale per i crawler di Anthropic: secondo la documentazione di Claude, bloccare ClaudeBot esclude i contenuti futuri dall'addestramento, mentre bloccare Claude-SearchBot può ridurre la tua visibilità nei risultati.
Un robots.txt che vuole restare visibile nelle risposte senza contribuire all'addestramento può essere simile a questo:
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /È una scelta, non una regola: molti brand preferiscono lasciare aperto anche l'addestramento, perché i modelli imparano a conoscere il marchio. L'importante è che sia una decisione presa consapevolmente, non un effetto collaterale.
Cloudflare: cosa è cambiato il 15 settembre 2026
Se il tuo sito passa da Cloudflare, controlla le impostazioni dei bot: le regole del CDN valgono anche quando il robots.txt è aperto. A luglio 2026 Cloudflare ha diviso i crawler AI in tre categorie: Search (indicizzazione per i risultati di ricerca), Agent (azioni automatiche per conto degli utenti) e Training (raccolta di dati per i modelli).
Dal 15 settembre 2026, per i nuovi domini, Training e Agent sono bloccati per impostazione predefinita sulle pagine che mostrano pubblicità, mentre Search resta consentito. Lo stesso giorno Cloudflare ha aggiornato il trattamento dei crawler a uso misto, come quelli di Google, Apple e Microsoft che servono sia la ricerca sia l'addestramento: i blocchi ora si applicano anche a loro. In pratica, un'impostazione troppo severa può togliere un sito anche dai risultati di ricerca classici.
Come controllare il tuo sito in 10 minuti
- Apri il robots.txt aggiungendo
/robots.txtall'indirizzo del tuo sito. Cerca le righeDisallowsotto gli user agent della tabella e una eventuale regolaUser-agent: *conDisallow: /, spesso dimenticata dopo un rifacimento del sito. - Controlla CDN e firewall. Su Cloudflare guarda le impostazioni dei bot AI nella sezione Sicurezza del dominio; su altri servizi cerca regole che bloccano user agent o intervalli di indirizzi IP. Anthropic avverte che bloccare gli indirizzi IP può impedire ai crawler di leggere il robots.txt, con effetti difficili da prevedere.
- Verifica che i contenuti siano nell'HTML. Uno studio di Vercel di dicembre 2024 ha rilevato che i principali crawler AI non eseguono JavaScript: se servizi, prezzi e recensioni compaiono solo dopo il caricamento della pagina, per loro non esistono.
- Guarda i log del server per capire quali crawler visitano davvero il sito e quali pagine ricevono errori.
- Dai tempo alle modifiche. OpenAI indica che servono circa 24 ore perché un aggiornamento del robots.txt venga recepito dai suoi sistemi.
Nell'analisi tecnica di Geosnap questi controlli sono automatici: il robots.txt viene letto per ogni crawler AI e gli errori che bloccano i bot compaiono tra le azioni da fare. Per capire da quali siti l'AI prende le informazioni quando non trova le tue, leggi anche da dove prendono le informazioni gli LLM.
Fonti
- Overview of OpenAI Crawlers (OpenAI, 2026)
- Anthropic raccoglie dati dal web e come i proprietari di siti possono bloccare il crawler (Anthropic, 2026)
- Perplexity Crawlers (Perplexity, 2026)
- I crawler comuni di Google (Google Search Central, 2026)
- Your site, your rules: new AI traffic options for all customers (Cloudflare, 2026-07-01)
- Have it both ways: stay discoverable in search while disallowing AI training (Cloudflare, 2026-09-15)
- The rise of the AI crawler (Vercel, 2024-12-17)
Domande frequenti
Se blocco GPTBot, il mio sito sparisce da ChatGPT?
No. GPTBot raccoglie contenuti per addestrare i modelli. Per comparire nelle risposte della ricerca di ChatGPT conta OAI-SearchBot: se lo lasci entrare, il sito resta citabile anche con GPTBot bloccato.
Bloccare Google-Extended penalizza il posizionamento su Google?
Secondo Google no: Google-Extended non influisce sull'inclusione nella Ricerca Google né sul posizionamento. Riguarda l'uso dei contenuti per addestrare Gemini e per il grounding.
Quanto tempo serve perché una modifica al robots.txt abbia effetto?
OpenAI indica circa 24 ore per i suoi sistemi. Gli altri fornitori non danno tempi precisi: ricontrolla dopo qualche giorno, anche nei log del server.
Il robots.txt basta per bloccare tutti i crawler AI?
No. I crawler che agiscono su richiesta di un utente, come Perplexity-User, possono non rispettarlo. Per un controllo più rigido servono le regole del CDN o del firewall, da usare con attenzione per non bloccare anche i crawler di ricerca.