# Il tuo sito blocca ChatGPT senza saperlo? Guida ai crawler AI

> GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot: cosa fa ogni crawler AI, come impostare il robots.txt e cosa cambia con le nuove regole di Cloudflare.

URL: https://geosnap.ai/blog/il-tuo-sito-blocca-chatgpt-guida-crawler-ai
Lingua: italiano
Versione EN: https://geosnap.ai/en/blog/il-tuo-sito-blocca-chatgpt-guida-crawler-ai
Autore: Rinald Sefa, CMO Geosnap · Categoria: Guide
Editore: Geosnap (Maind Group S.r.l.), https://geosnap.ai

## In breve

ChatGPT, Claude e Perplexity possono citarti solo se i loro crawler di ricerca leggono il tuo sito. Puoi bloccare l'addestramento dei modelli e restare citabile, ma devi distinguere i crawler giusti nel robots.txt e controllare anche CDN e firewall, a partire dalle nuove impostazioni di Cloudflare del 15 settembre 2026.

- Ogni fornitore AI usa crawler diversi per la ricerca, per l'addestramento e per le richieste degli utenti.
- Bloccare GPTBot o ClaudeBot ferma l'addestramento; bloccare OAI-SearchBot o Claude-SearchBot ti toglie dalle risposte.
- Dal 15 settembre 2026 Cloudflare blocca per impostazione predefinita Training e Agent sulle pagine con pubblicità dei nuovi domini.
- Il controllo richiede dieci minuti: robots.txt, impostazioni del CDN, contenuti nell'HTML e log del server.

Scritto dall'agente AI di Geosnap, rivisto e approvato da Rinald Sefa.

Se ChatGPT, Claude o Perplexity non citano mai il tuo sito, la causa può essere più banale di quanto pensi: una regola nel file `robots.txt`, un'impostazione del CDN o un firewall che tiene fuori i loro crawler. Nessuno se ne accorge, perché le persone continuano a vedere il sito normalmente. In questa guida vediamo quali crawler AI esistono, cosa fa ciascuno, come decidere chi lasciare entrare e cosa è cambiato con le nuove impostazioni di Cloudflare.

## Perché il robots.txt conta per farti citare dall'AI

Gli assistenti AI possono citare solo le pagine che riescono a leggere. Prima di rispondere a una domanda, ChatGPT, Claude e Perplexity cercano sul web con i propri crawler: se il tuo sito li blocca, nelle risposte comparirà qualcun altro.

Il `robots.txt` è il file, nella radice del sito, in cui dici ai crawler cosa possono visitare. I crawler AI dei principali fornitori dichiarano di rispettarlo, quindi una singola riga `Disallow` basta a farti sparire dalle loro ricerche. Il problema è che molte di queste righe sono state aggiunte negli ultimi anni per bloccare l'addestramento dei modelli, senza distinguere tra chi raccoglie dati per addestrare e chi cerca fonti da citare.

## Quali crawler AI esistono e cosa fanno

Ogni fornitore usa più crawler con scopi diversi. Questi sono quelli documentati ufficialmente:

| Fornitore | User agent | A cosa serve | Rispetta il robots.txt |
| --- | --- | --- | --- |
| OpenAI | `OAI-SearchBot` | Trovare i siti da mostrare nella ricerca di ChatGPT | Sì |
| OpenAI | `GPTBot` | Raccogliere contenuti per addestrare i modelli | Sì |
| OpenAI | `ChatGPT-User` | Visitare una pagina quando lo chiede un utente | Non sempre |
| Anthropic | `Claude-SearchBot` | Indicizzare i contenuti per le ricerche di Claude | Sì |
| Anthropic | `ClaudeBot` | Raccogliere contenuti per l'addestramento | Sì |
| Anthropic | `Claude-User` | Leggere una pagina su richiesta di un utente | Sì |
| Perplexity | `PerplexityBot` | Mostrare e linkare i siti nei risultati di Perplexity | Sì |
| Perplexity | `Perplexity-User` | Visitare una pagina su richiesta di un utente | In genere no |
| Google | `Google-Extended` | Uso dei contenuti per addestrare Gemini e per il grounding | Sì |

OpenAI spiega che i [siti che bloccano OAI-SearchBot non vengono mostrati nelle risposte della ricerca di ChatGPT](https://developers.openai.com/api/docs/bots), al massimo come link di navigazione. Perplexity precisa che [Perplexity-User in genere ignora il robots.txt](https://docs.perplexity.ai/guides/bots), perché la visita è richiesta da una persona. Google, invece, chiarisce che [Google-Extended non influisce sull'inclusione nella Ricerca Google né sul posizionamento](https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers).

## Ricerca e addestramento si possono separare

Sì: puoi impedire che i tuoi contenuti vengano usati per addestrare i modelli e restare comunque citabile. OpenAI lo dice esplicitamente: [ogni impostazione è indipendente dalle altre](https://developers.openai.com/api/docs/bots), quindi puoi permettere OAI-SearchBot e bloccare GPTBot. Lo stesso vale per i crawler di Anthropic: secondo la [documentazione di Claude](https://support.claude.com/en/articles/8896518-what-is-claudebot), bloccare ClaudeBot esclude i contenuti futuri dall'addestramento, mentre bloccare Claude-SearchBot può ridurre la tua visibilità nei risultati.

Un `robots.txt` che vuole restare visibile nelle risposte senza contribuire all'addestramento può essere simile a questo:

```
User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /
```

È una scelta, non una regola: molti brand preferiscono lasciare aperto anche l'addestramento, perché i modelli imparano a conoscere il marchio. L'importante è che sia una decisione presa consapevolmente, non un effetto collaterale.

## Cloudflare: cosa è cambiato il 15 settembre 2026

Se il tuo sito passa da Cloudflare, controlla le impostazioni dei bot: le regole del CDN valgono anche quando il `robots.txt` è aperto. A luglio 2026 Cloudflare ha [diviso i crawler AI in tre categorie](https://blog.cloudflare.com/content-independence-day-ai-options/): Search (indicizzazione per i risultati di ricerca), Agent (azioni automatiche per conto degli utenti) e Training (raccolta di dati per i modelli).

Dal 15 settembre 2026, per i nuovi domini, Training e Agent sono bloccati per impostazione predefinita sulle pagine che mostrano pubblicità, mentre Search resta consentito. Lo stesso giorno Cloudflare ha [aggiornato il trattamento dei crawler a uso misto](https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/), come quelli di Google, Apple e Microsoft che servono sia la ricerca sia l'addestramento: i blocchi ora si applicano anche a loro. In pratica, un'impostazione troppo severa può togliere un sito anche dai risultati di ricerca classici.

## Come controllare il tuo sito in 10 minuti

1. **Apri il robots.txt** aggiungendo `/robots.txt` all'indirizzo del tuo sito. Cerca le righe `Disallow` sotto gli user agent della tabella e una eventuale regola `User-agent: *` con `Disallow: /`, spesso dimenticata dopo un rifacimento del sito.
2. **Controlla CDN e firewall.** Su Cloudflare guarda le impostazioni dei bot AI nella sezione Sicurezza del dominio; su altri servizi cerca regole che bloccano user agent o intervalli di indirizzi IP. Anthropic avverte che [bloccare gli indirizzi IP può impedire ai crawler di leggere il robots.txt](https://support.claude.com/en/articles/8896518-what-is-claudebot), con effetti difficili da prevedere.
3. **Verifica che i contenuti siano nell'HTML.** Uno [studio di Vercel di dicembre 2024](https://vercel.com/blog/the-rise-of-the-ai-crawler) ha rilevato che i principali crawler AI non eseguono JavaScript: se servizi, prezzi e recensioni compaiono solo dopo il caricamento della pagina, per loro non esistono.
4. **Guarda i log del server** per capire quali crawler visitano davvero il sito e quali pagine ricevono errori.
5. **Dai tempo alle modifiche.** OpenAI indica che servono [circa 24 ore](https://developers.openai.com/api/docs/bots) perché un aggiornamento del robots.txt venga recepito dai suoi sistemi.

Nell'[analisi tecnica di Geosnap](https://geosnap.ai/features) questi controlli sono automatici: il robots.txt viene letto per ogni crawler AI e gli errori che bloccano i bot compaiono tra le azioni da fare. Per capire da quali siti l'AI prende le informazioni quando non trova le tue, leggi anche [da dove prendono le informazioni gli LLM](https://geosnap.ai/blog/sources-ai-da-dove-prendono-informazioni-llm).

## Fonti

- [Overview of OpenAI Crawlers](https://developers.openai.com/api/docs/bots) (OpenAI, 2026)
- [Anthropic raccoglie dati dal web e come i proprietari di siti possono bloccare il crawler](https://support.claude.com/en/articles/8896518-what-is-claudebot) (Anthropic, 2026)
- [Perplexity Crawlers](https://docs.perplexity.ai/guides/bots) (Perplexity, 2026)
- [I crawler comuni di Google](https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers) (Google Search Central, 2026)
- [Your site, your rules: new AI traffic options for all customers](https://blog.cloudflare.com/content-independence-day-ai-options/) (Cloudflare, 2026-07-01)
- [Have it both ways: stay discoverable in search while disallowing AI training](https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/) (Cloudflare, 2026-09-15)
- [The rise of the AI crawler](https://vercel.com/blog/the-rise-of-the-ai-crawler) (Vercel, 2024-12-17)

## Domande frequenti

### Se blocco GPTBot, il mio sito sparisce da ChatGPT?

No. GPTBot raccoglie contenuti per addestrare i modelli. Per comparire nelle risposte della ricerca di ChatGPT conta OAI-SearchBot: se lo lasci entrare, il sito resta citabile anche con GPTBot bloccato.

### Bloccare Google-Extended penalizza il posizionamento su Google?

Secondo Google no: Google-Extended non influisce sull'inclusione nella Ricerca Google né sul posizionamento. Riguarda l'uso dei contenuti per addestrare Gemini e per il grounding.

### Quanto tempo serve perché una modifica al robots.txt abbia effetto?

OpenAI indica circa 24 ore per i suoi sistemi. Gli altri fornitori non danno tempi precisi: ricontrolla dopo qualche giorno, anche nei log del server.

### Il robots.txt basta per bloccare tutti i crawler AI?

No. I crawler che agiscono su richiesta di un utente, come Perplexity-User, possono non rispettarlo. Per un controllo più rigido servono le regole del CDN o del firewall, da usare con attenzione per non bloccare anche i crawler di ricerca.
