Come l'AI legge questa pagina

ChatGPT, Claude, Gemini e Perplexity non guardano colori, immagini e animazioni. Ricevono testo, titoli, link e dati strutturati. Qui sotto trovi esattamente quello che leggono quando aprono «Il tuo sito blocca ChatGPT senza saperlo? Guida ai crawler AI».

L'AI riceve 1.311 parole divise in 8 sezioni, 19 link e 3 blocchi di dati strutturati.

geosnap.ai/blog/il-tuo-sito-blocca-chatgpt-guida-crawler-ai.md

Testo

Il contenuto della pagina in Markdown, senza menu né grafica. È il formato più vicino a come un modello linguistico legge un testo.

# Il tuo sito blocca ChatGPT senza saperlo? Guida ai crawler AI

> GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot: cosa fa ogni crawler AI, come impostare il robots.txt e cosa cambia con le nuove regole di Cloudflare.

URL: https://geosnap.ai/blog/il-tuo-sito-blocca-chatgpt-guida-crawler-ai
Lingua: italiano
Versione EN: https://geosnap.ai/en/blog/il-tuo-sito-blocca-chatgpt-guida-crawler-ai
Autore: Rinald Sefa, CMO Geosnap · Categoria: Guide
Editore: Geosnap (Maind Group S.r.l.), https://geosnap.ai

## In breve

ChatGPT, Claude e Perplexity possono citarti solo se i loro crawler di ricerca leggono il tuo sito. Puoi bloccare l'addestramento dei modelli e restare citabile, ma devi distinguere i crawler giusti nel robots.txt e controllare anche CDN e firewall, a partire dalle nuove impostazioni di Cloudflare del 15 settembre 2026.

- Ogni fornitore AI usa crawler diversi per la ricerca, per l'addestramento e per le richieste degli utenti.
- Bloccare GPTBot o ClaudeBot ferma l'addestramento; bloccare OAI-SearchBot o Claude-SearchBot ti toglie dalle risposte.
- Dal 15 settembre 2026 Cloudflare blocca per impostazione predefinita Training e Agent sulle pagine con pubblicità dei nuovi domini.
- Il controllo richiede dieci minuti: robots.txt, impostazioni del CDN, contenuti nell'HTML e log del server.

Scritto dall'agente AI di Geosnap, rivisto e approvato da Rinald Sefa.

Se ChatGPT, Claude o Perplexity non citano mai il tuo sito, la causa può essere più banale di quanto pensi: una regola nel file `robots.txt`, un'impostazione del CDN o un firewall che tiene fuori i loro crawler. Nessuno se ne accorge, perché le persone continuano a vedere il sito normalmente. In questa guida vediamo quali crawler AI esistono, cosa fa ciascuno, come decidere chi lasciare entrare e cosa è cambiato con le nuove impostazioni di Cloudflare.

## Perché il robots.txt conta per farti citare dall'AI

Gli assistenti AI possono citare solo le pagine che riescono a leggere. Prima di rispondere a una domanda, ChatGPT, Claude e Perplexity cercano sul web con i propri crawler: se il tuo sito li blocca, nelle risposte comparirà qualcun altro.

Il `robots.txt` è il file, nella radice del sito, in cui dici ai crawler cosa possono visitare. I crawler AI dei principali fornitori dichiarano di rispettarlo, quindi una singola riga `Disallow` basta a farti sparire dalle loro ricerche. Il problema è che molte di queste righe sono state aggiunte negli ultimi anni per bloccare l'addestramento dei modelli, senza distinguere tra chi raccoglie dati per addestrare e chi cerca fonti da citare.

## Quali crawler AI esistono e cosa fanno

Ogni fornitore usa più crawler con scopi diversi. Questi sono quelli documentati ufficialmente:

| Fornitore | User agent | A cosa serve | Rispetta il robots.txt |
| --- | --- | --- | --- |
| OpenAI | `OAI-SearchBot` | Trovare i siti da mostrare nella ricerca di ChatGPT | Sì |
| OpenAI | `GPTBot` | Raccogliere contenuti per addestrare i modelli | Sì |
| OpenAI | `ChatGPT-User` | Visitare una pagina quando lo chiede un utente | Non sempre |
| Anthropic | `Claude-SearchBot` | Indicizzare i contenuti per le ricerche di Claude | Sì |
| Anthropic | `ClaudeBot` | Raccogliere contenuti per l'addestramento | Sì |
| Anthropic | `Claude-User` | Leggere una pagina su richiesta di un utente | Sì |
| Perplexity | `PerplexityBot` | Mostrare e linkare i siti nei risultati di Perplexity | Sì |
| Perplexity | `Perplexity-User` | Visitare una pagina su richiesta di un utente | In genere no |
| Google | `Google-Extended` | Uso dei contenuti per addestrare Gemini e per il grounding | Sì |

OpenAI spiega che i [siti che bloccano OAI-SearchBot non vengono mostrati nelle risposte della ricerca di ChatGPT](https://developers.openai.com/api/docs/bots), al massimo come link di navigazione. Perplexity precisa che [Perplexity-User in genere ignora il robots.txt](https://docs.perplexity.ai/guides/bots), perché la visita è richiesta da una persona. Google, invece, chiarisce che [Google-Extended non influisce sull'inclusione nella Ricerca Google né sul posizionamento](https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers).

## Ricerca e addestramento si possono separare

Sì: puoi impedire che i tuoi contenuti vengano usati per addestrare i modelli e restare comunque citabile. OpenAI lo dice esplicitamente: [ogni impostazione è indipendente dalle altre](https://developers.openai.com/api/docs/bots), quindi puoi permettere OAI-SearchBot e bloccare GPTBot. Lo stesso vale per i crawler di Anthropic: secondo la [documentazione di Claude](https://support.claude.com/en/articles/8896518-what-is-claudebot), bloccare ClaudeBot esclude i contenuti futuri dall'addestramento, mentre bloccare Claude-SearchBot può ridurre la tua visibilità nei risultati.

Un `robots.txt` che vuole restare visibile nelle risposte senza contribuire all'addestramento può essere simile a questo:

```
User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /
```

È una scelta, non una regola: molti brand preferiscono lasciare aperto anche l'addestramento, perché i modelli imparano a conoscere il marchio. L'importante è che sia una decisione presa consapevolmente, non un effetto collaterale.

## Cloudflare: cosa è cambiato il 15 settembre 2026

Se il tuo sito passa da Cloudflare, controlla le impostazioni dei bot: le regole del CDN valgono anche quando il `robots.txt` è aperto. A luglio 2026 Cloudflare ha [diviso i crawler AI in tre categorie](https://blog.cloudflare.com/content-independence-day-ai-options/): Search (indicizzazione per i risultati di ricerca), Agent (azioni automatiche per conto degli utenti) e Training (raccolta di dati per i modelli).

Dal 15 settembre 2026, per i nuovi domini, Training e Agent sono bloccati per impostazione predefinita sulle pagine che mostrano pubblicità, mentre Search resta consentito. Lo stesso giorno Cloudflare ha [aggiornato il trattamento dei crawler a uso misto](https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/), come quelli di Google, Apple e Microsoft che servono sia la ricerca sia l'addestramento: i blocchi ora si applicano anche a loro. In pratica, un'impostazione troppo severa può togliere un sito anche dai risultati di ricerca classici.

## Come controllare il tuo sito in 10 minuti

1. **Apri il robots.txt** aggiungendo `/robots.txt` all'indirizzo del tuo sito. Cerca le righe `Disallow` sotto gli user agent della tabella e una eventuale regola `User-agent: *` con `Disallow: /`, spesso dimenticata dopo un rifacimento del sito.
2. **Controlla CDN e firewall.** Su Cloudflare guarda le impostazioni dei bot AI nella sezione Sicurezza del dominio; su altri servizi cerca regole che bloccano user agent o intervalli di indirizzi IP. Anthropic avverte che [bloccare gli indirizzi IP può impedire ai crawler di leggere il robots.txt](https://support.claude.com/en/articles/8896518-what-is-claudebot), con effetti difficili da prevedere.
3. **Verifica che i contenuti siano nell'HTML.** Uno [studio di Vercel di dicembre 2024](https://vercel.com/blog/the-rise-of-the-ai-crawler) ha rilevato che i principali crawler AI non eseguono JavaScript: se servizi, prezzi e recensioni compaiono solo dopo il caricamento della pagina, per loro non esistono.
4. **Guarda i log del server** per capire quali crawler visitano davvero il sito e quali pagine ricevono errori.
5. **Dai tempo alle modifiche.** OpenAI indica che servono [circa 24 ore](https://developers.openai.com/api/docs/bots) perché un aggiornamento del robots.txt venga recepito dai suoi sistemi.

Nell'[analisi tecnica di Geosnap](https://geosnap.ai/features) questi controlli sono automatici: il robots.txt viene letto per ogni crawler AI e gli errori che bloccano i bot compaiono tra le azioni da fare. Per capire da quali siti l'AI prende le informazioni quando non trova le tue, leggi anche [da dove prendono le informazioni gli LLM](https://geosnap.ai/blog/sources-ai-da-dove-prendono-informazioni-llm).

## Fonti

- [Overview of OpenAI Crawlers](https://developers.openai.com/api/docs/bots) (OpenAI, 2026)
- [Anthropic raccoglie dati dal web e come i proprietari di siti possono bloccare il crawler](https://support.claude.com/en/articles/8896518-what-is-claudebot) (Anthropic, 2026)
- [Perplexity Crawlers](https://docs.perplexity.ai/guides/bots) (Perplexity, 2026)
- [I crawler comuni di Google](https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers) (Google Search Central, 2026)
- [Your site, your rules: new AI traffic options for all customers](https://blog.cloudflare.com/content-independence-day-ai-options/) (Cloudflare, 2026-07-01)
- [Have it both ways: stay discoverable in search while disallowing AI training](https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/) (Cloudflare, 2026-09-15)
- [The rise of the AI crawler](https://vercel.com/blog/the-rise-of-the-ai-crawler) (Vercel, 2024-12-17)

## Domande frequenti

### Se blocco GPTBot, il mio sito sparisce da ChatGPT?

No. GPTBot raccoglie contenuti per addestrare i modelli. Per comparire nelle risposte della ricerca di ChatGPT conta OAI-SearchBot: se lo lasci entrare, il sito resta citabile anche con GPTBot bloccato.

### Bloccare Google-Extended penalizza il posizionamento su Google?

Secondo Google no: Google-Extended non influisce sull'inclusione nella Ricerca Google né sul posizionamento. Riguarda l'uso dei contenuti per addestrare Gemini e per il grounding.

### Quanto tempo serve perché una modifica al robots.txt abbia effetto?

OpenAI indica circa 24 ore per i suoi sistemi. Gli altri fornitori non danno tempi precisi: ricontrolla dopo qualche giorno, anche nei log del server.

### Il robots.txt basta per bloccare tutti i crawler AI?

No. I crawler che agiscono su richiesta di un utente, come Perplexity-User, possono non rispettarlo. Per un controllo più rigido servono le regole del CDN o del firewall, da usare con attenzione per non bloccare anche i crawler di ricerca.

Dati strutturati

Dati in formato Schema.org (JSON-LD) inseriti nel codice della pagina. Dicono all'AI in modo esplicito di cosa parla la pagina e chi l'ha pubblicata.

BreadcrumbList descrive il percorso nel sito

{
  "@context": "https://schema.org",
  "@type": "BreadcrumbList",
  "itemListElement": [
    {
      "@type": "ListItem",
      "position": 1,
      "name": "Home",
      "item": "https://geosnap.ai/"
    },
    {
      "@type": "ListItem",
      "position": 2,
      "name": "Blog",
      "item": "https://geosnap.ai/blog/"
    },
    {
      "@type": "ListItem",
      "position": 3,
      "name": "Guide",
      "item": "https://geosnap.ai/blog/#guide"
    },
    {
      "@type": "ListItem",
      "position": 4,
      "name": "Il tuo sito blocca ChatGPT senza saperlo? Guida ai crawler AI",
      "item": "https://geosnap.ai/blog/il-tuo-sito-blocca-chatgpt-guida-crawler-ai"
    }
  ]
}

BlogPosting descrive l'articolo: autore, date e fonti

{
  "@context": "https://schema.org",
  "@type": "BlogPosting",
  "@id": "https://geosnap.ai/blog/il-tuo-sito-blocca-chatgpt-guida-crawler-ai#article",
  "headline": "Il tuo sito blocca ChatGPT senza saperlo? Guida ai crawler AI",
  "description": "GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot: cosa fa ogni crawler AI, come impostare il robots.txt e cosa cambia con le nuove regole di Cloudflare.",
  "inLanguage": "it",
  "url": "https://geosnap.ai/blog/il-tuo-sito-blocca-chatgpt-guida-crawler-ai",
  "mainEntityOfPage": "https://geosnap.ai/blog/il-tuo-sito-blocca-chatgpt-guida-crawler-ai",
  "image": "https://geosnap.ai/img/blog/p2026-10-05-crawler-ai.webp",
  "articleSection": "Guide",
  "wordCount": 969,
  "author": {
    "@type": "Person",
    "name": "Rinald Sefa",
    "jobTitle": "CMO",
    "url": "https://geosnap.ai/about",
    "worksFor": {
      "@id": "https://geosnap.ai/#organization"
    }
  },
  "publisher": {
    "@id": "https://geosnap.ai/#organization"
  },
  "isAccessibleForFree": true,
  "abstract": "ChatGPT, Claude e Perplexity possono citarti solo se i loro crawler di ricerca leggono il tuo sito. Puoi bloccare l'addestramento dei modelli e restare citabile, ma devi distinguere i crawler giusti nel robots.txt e controllare anche CDN e firewall, a partire dalle nuove impostazioni di Cloudflare del 15 settembre 2026.",
  "datePublished": "2026-10-05",
  "dateModified": "2026-10-05",
  "citation": [
    "https://developers.openai.com/api/docs/bots",
    "https://support.claude.com/en/articles/8896518-what-is-claudebot",
    "https://docs.perplexity.ai/guides/bots",
    "https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers",
    "https://blog.cloudflare.com/content-independence-day-ai-options/",
    "https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/",
    "https://vercel.com/blog/the-rise-of-the-ai-crawler"
  ],
  "workTranslation": {
    "@id": "https://geosnap.ai/en/blog/il-tuo-sito-blocca-chatgpt-guida-crawler-ai#article"
  }
}

FAQPage descrive le domande frequenti

{
  "@context": "https://schema.org",
  "@type": "FAQPage",
  "@id": "https://geosnap.ai/blog/il-tuo-sito-blocca-chatgpt-guida-crawler-ai#faq",
  "mainEntity": [
    {
      "@type": "Question",
      "name": "Se blocco GPTBot, il mio sito sparisce da ChatGPT?",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "No. GPTBot raccoglie contenuti per addestrare i modelli. Per comparire nelle risposte della ricerca di ChatGPT conta OAI-SearchBot: se lo lasci entrare, il sito resta citabile anche con GPTBot bloccato."
      }
    },
    {
      "@type": "Question",
      "name": "Bloccare Google-Extended penalizza il posizionamento su Google?",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Secondo Google no: Google-Extended non influisce sull'inclusione nella Ricerca Google né sul posizionamento. Riguarda l'uso dei contenuti per addestrare Gemini e per il grounding."
      }
    },
    {
      "@type": "Question",
      "name": "Quanto tempo serve perché una modifica al robots.txt abbia effetto?",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "OpenAI indica circa 24 ore per i suoi sistemi. Gli altri fornitori non danno tempi precisi: ricontrolla dopo qualche giorno, anche nei log del server."
      }
    },
    {
      "@type": "Question",
      "name": "Il robots.txt basta per bloccare tutti i crawler AI?",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "No. I crawler che agiscono su richiesta di un utente, come Perplexity-User, possono non rispettarlo. Per un controllo più rigido servono le regole del CDN o del firewall, da usare con attenzione per non bloccare anche i crawler di ricerca."
      }
    }
  ]
}

Metadati

Le informazioni nell'intestazione della pagina, che crawler e motori leggono prima del contenuto.

Titolo
Il tuo sito blocca ChatGPT senza saperlo? Guida ai crawler AI 61 caratteri
Descrizione
GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot: cosa fa ogni crawler AI, come impostare il robots.txt e cosa cambia con le nuove regole di Cloudflare. 151 caratteri
Lingua
italiano
Indicazioni per i crawler
index, follow, max-image-preview:large, max-snippet:-1
Ultimo aggiornamento
5 ottobre 2026