Come l'AI legge questa pagina
ChatGPT, Claude, Gemini e Perplexity non guardano colori, immagini e animazioni. Ricevono testo, titoli, link e dati strutturati. Qui sotto trovi esattamente quello che leggono quando aprono «Il tuo sito blocca ChatGPT senza saperlo? Guida ai crawler AI».
L'AI riceve 1.311 parole divise in 8 sezioni, 19 link e 3 blocchi di dati strutturati.
Testo
Il contenuto della pagina in Markdown, senza menu né grafica. È il formato più vicino a come un modello linguistico legge un testo.
# Il tuo sito blocca ChatGPT senza saperlo? Guida ai crawler AI > GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot: cosa fa ogni crawler AI, come impostare il robots.txt e cosa cambia con le nuove regole di Cloudflare. URL: https://geosnap.ai/blog/il-tuo-sito-blocca-chatgpt-guida-crawler-ai Lingua: italiano Versione EN: https://geosnap.ai/en/blog/il-tuo-sito-blocca-chatgpt-guida-crawler-ai Autore: Rinald Sefa, CMO Geosnap · Categoria: Guide Editore: Geosnap (Maind Group S.r.l.), https://geosnap.ai ## In breve ChatGPT, Claude e Perplexity possono citarti solo se i loro crawler di ricerca leggono il tuo sito. Puoi bloccare l'addestramento dei modelli e restare citabile, ma devi distinguere i crawler giusti nel robots.txt e controllare anche CDN e firewall, a partire dalle nuove impostazioni di Cloudflare del 15 settembre 2026. - Ogni fornitore AI usa crawler diversi per la ricerca, per l'addestramento e per le richieste degli utenti. - Bloccare GPTBot o ClaudeBot ferma l'addestramento; bloccare OAI-SearchBot o Claude-SearchBot ti toglie dalle risposte. - Dal 15 settembre 2026 Cloudflare blocca per impostazione predefinita Training e Agent sulle pagine con pubblicità dei nuovi domini. - Il controllo richiede dieci minuti: robots.txt, impostazioni del CDN, contenuti nell'HTML e log del server. Scritto dall'agente AI di Geosnap, rivisto e approvato da Rinald Sefa. Se ChatGPT, Claude o Perplexity non citano mai il tuo sito, la causa può essere più banale di quanto pensi: una regola nel file `robots.txt`, un'impostazione del CDN o un firewall che tiene fuori i loro crawler. Nessuno se ne accorge, perché le persone continuano a vedere il sito normalmente. In questa guida vediamo quali crawler AI esistono, cosa fa ciascuno, come decidere chi lasciare entrare e cosa è cambiato con le nuove impostazioni di Cloudflare. ## Perché il robots.txt conta per farti citare dall'AI Gli assistenti AI possono citare solo le pagine che riescono a leggere. Prima di rispondere a una domanda, ChatGPT, Claude e Perplexity cercano sul web con i propri crawler: se il tuo sito li blocca, nelle risposte comparirà qualcun altro. Il `robots.txt` è il file, nella radice del sito, in cui dici ai crawler cosa possono visitare. I crawler AI dei principali fornitori dichiarano di rispettarlo, quindi una singola riga `Disallow` basta a farti sparire dalle loro ricerche. Il problema è che molte di queste righe sono state aggiunte negli ultimi anni per bloccare l'addestramento dei modelli, senza distinguere tra chi raccoglie dati per addestrare e chi cerca fonti da citare. ## Quali crawler AI esistono e cosa fanno Ogni fornitore usa più crawler con scopi diversi. Questi sono quelli documentati ufficialmente: | Fornitore | User agent | A cosa serve | Rispetta il robots.txt | | --- | --- | --- | --- | | OpenAI | `OAI-SearchBot` | Trovare i siti da mostrare nella ricerca di ChatGPT | Sì | | OpenAI | `GPTBot` | Raccogliere contenuti per addestrare i modelli | Sì | | OpenAI | `ChatGPT-User` | Visitare una pagina quando lo chiede un utente | Non sempre | | Anthropic | `Claude-SearchBot` | Indicizzare i contenuti per le ricerche di Claude | Sì | | Anthropic | `ClaudeBot` | Raccogliere contenuti per l'addestramento | Sì | | Anthropic | `Claude-User` | Leggere una pagina su richiesta di un utente | Sì | | Perplexity | `PerplexityBot` | Mostrare e linkare i siti nei risultati di Perplexity | Sì | | Perplexity | `Perplexity-User` | Visitare una pagina su richiesta di un utente | In genere no | | Google | `Google-Extended` | Uso dei contenuti per addestrare Gemini e per il grounding | Sì | OpenAI spiega che i [siti che bloccano OAI-SearchBot non vengono mostrati nelle risposte della ricerca di ChatGPT](https://developers.openai.com/api/docs/bots), al massimo come link di navigazione. Perplexity precisa che [Perplexity-User in genere ignora il robots.txt](https://docs.perplexity.ai/guides/bots), perché la visita è richiesta da una persona. Google, invece, chiarisce che [Google-Extended non influisce sull'inclusione nella Ricerca Google né sul posizionamento](https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers). ## Ricerca e addestramento si possono separare Sì: puoi impedire che i tuoi contenuti vengano usati per addestrare i modelli e restare comunque citabile. OpenAI lo dice esplicitamente: [ogni impostazione è indipendente dalle altre](https://developers.openai.com/api/docs/bots), quindi puoi permettere OAI-SearchBot e bloccare GPTBot. Lo stesso vale per i crawler di Anthropic: secondo la [documentazione di Claude](https://support.claude.com/en/articles/8896518-what-is-claudebot), bloccare ClaudeBot esclude i contenuti futuri dall'addestramento, mentre bloccare Claude-SearchBot può ridurre la tua visibilità nei risultati. Un `robots.txt` che vuole restare visibile nelle risposte senza contribuire all'addestramento può essere simile a questo: ``` User-agent: OAI-SearchBot Allow: / User-agent: Claude-SearchBot Allow: / User-agent: PerplexityBot Allow: / User-agent: GPTBot Disallow: / User-agent: ClaudeBot Disallow: / User-agent: Google-Extended Disallow: / ``` È una scelta, non una regola: molti brand preferiscono lasciare aperto anche l'addestramento, perché i modelli imparano a conoscere il marchio. L'importante è che sia una decisione presa consapevolmente, non un effetto collaterale. ## Cloudflare: cosa è cambiato il 15 settembre 2026 Se il tuo sito passa da Cloudflare, controlla le impostazioni dei bot: le regole del CDN valgono anche quando il `robots.txt` è aperto. A luglio 2026 Cloudflare ha [diviso i crawler AI in tre categorie](https://blog.cloudflare.com/content-independence-day-ai-options/): Search (indicizzazione per i risultati di ricerca), Agent (azioni automatiche per conto degli utenti) e Training (raccolta di dati per i modelli). Dal 15 settembre 2026, per i nuovi domini, Training e Agent sono bloccati per impostazione predefinita sulle pagine che mostrano pubblicità, mentre Search resta consentito. Lo stesso giorno Cloudflare ha [aggiornato il trattamento dei crawler a uso misto](https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/), come quelli di Google, Apple e Microsoft che servono sia la ricerca sia l'addestramento: i blocchi ora si applicano anche a loro. In pratica, un'impostazione troppo severa può togliere un sito anche dai risultati di ricerca classici. ## Come controllare il tuo sito in 10 minuti 1. **Apri il robots.txt** aggiungendo `/robots.txt` all'indirizzo del tuo sito. Cerca le righe `Disallow` sotto gli user agent della tabella e una eventuale regola `User-agent: *` con `Disallow: /`, spesso dimenticata dopo un rifacimento del sito. 2. **Controlla CDN e firewall.** Su Cloudflare guarda le impostazioni dei bot AI nella sezione Sicurezza del dominio; su altri servizi cerca regole che bloccano user agent o intervalli di indirizzi IP. Anthropic avverte che [bloccare gli indirizzi IP può impedire ai crawler di leggere il robots.txt](https://support.claude.com/en/articles/8896518-what-is-claudebot), con effetti difficili da prevedere. 3. **Verifica che i contenuti siano nell'HTML.** Uno [studio di Vercel di dicembre 2024](https://vercel.com/blog/the-rise-of-the-ai-crawler) ha rilevato che i principali crawler AI non eseguono JavaScript: se servizi, prezzi e recensioni compaiono solo dopo il caricamento della pagina, per loro non esistono. 4. **Guarda i log del server** per capire quali crawler visitano davvero il sito e quali pagine ricevono errori. 5. **Dai tempo alle modifiche.** OpenAI indica che servono [circa 24 ore](https://developers.openai.com/api/docs/bots) perché un aggiornamento del robots.txt venga recepito dai suoi sistemi. Nell'[analisi tecnica di Geosnap](https://geosnap.ai/features) questi controlli sono automatici: il robots.txt viene letto per ogni crawler AI e gli errori che bloccano i bot compaiono tra le azioni da fare. Per capire da quali siti l'AI prende le informazioni quando non trova le tue, leggi anche [da dove prendono le informazioni gli LLM](https://geosnap.ai/blog/sources-ai-da-dove-prendono-informazioni-llm). ## Fonti - [Overview of OpenAI Crawlers](https://developers.openai.com/api/docs/bots) (OpenAI, 2026) - [Anthropic raccoglie dati dal web e come i proprietari di siti possono bloccare il crawler](https://support.claude.com/en/articles/8896518-what-is-claudebot) (Anthropic, 2026) - [Perplexity Crawlers](https://docs.perplexity.ai/guides/bots) (Perplexity, 2026) - [I crawler comuni di Google](https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers) (Google Search Central, 2026) - [Your site, your rules: new AI traffic options for all customers](https://blog.cloudflare.com/content-independence-day-ai-options/) (Cloudflare, 2026-07-01) - [Have it both ways: stay discoverable in search while disallowing AI training](https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/) (Cloudflare, 2026-09-15) - [The rise of the AI crawler](https://vercel.com/blog/the-rise-of-the-ai-crawler) (Vercel, 2024-12-17) ## Domande frequenti ### Se blocco GPTBot, il mio sito sparisce da ChatGPT? No. GPTBot raccoglie contenuti per addestrare i modelli. Per comparire nelle risposte della ricerca di ChatGPT conta OAI-SearchBot: se lo lasci entrare, il sito resta citabile anche con GPTBot bloccato. ### Bloccare Google-Extended penalizza il posizionamento su Google? Secondo Google no: Google-Extended non influisce sull'inclusione nella Ricerca Google né sul posizionamento. Riguarda l'uso dei contenuti per addestrare Gemini e per il grounding. ### Quanto tempo serve perché una modifica al robots.txt abbia effetto? OpenAI indica circa 24 ore per i suoi sistemi. Gli altri fornitori non danno tempi precisi: ricontrolla dopo qualche giorno, anche nei log del server. ### Il robots.txt basta per bloccare tutti i crawler AI? No. I crawler che agiscono su richiesta di un utente, come Perplexity-User, possono non rispettarlo. Per un controllo più rigido servono le regole del CDN o del firewall, da usare con attenzione per non bloccare anche i crawler di ricerca.
Dati strutturati
Dati in formato Schema.org (JSON-LD) inseriti nel codice della pagina. Dicono all'AI in modo esplicito di cosa parla la pagina e chi l'ha pubblicata.
BreadcrumbList descrive il percorso nel sito
{
"@context": "https://schema.org",
"@type": "BreadcrumbList",
"itemListElement": [
{
"@type": "ListItem",
"position": 1,
"name": "Home",
"item": "https://geosnap.ai/"
},
{
"@type": "ListItem",
"position": 2,
"name": "Blog",
"item": "https://geosnap.ai/blog/"
},
{
"@type": "ListItem",
"position": 3,
"name": "Guide",
"item": "https://geosnap.ai/blog/#guide"
},
{
"@type": "ListItem",
"position": 4,
"name": "Il tuo sito blocca ChatGPT senza saperlo? Guida ai crawler AI",
"item": "https://geosnap.ai/blog/il-tuo-sito-blocca-chatgpt-guida-crawler-ai"
}
]
}
BlogPosting descrive l'articolo: autore, date e fonti
{
"@context": "https://schema.org",
"@type": "BlogPosting",
"@id": "https://geosnap.ai/blog/il-tuo-sito-blocca-chatgpt-guida-crawler-ai#article",
"headline": "Il tuo sito blocca ChatGPT senza saperlo? Guida ai crawler AI",
"description": "GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot: cosa fa ogni crawler AI, come impostare il robots.txt e cosa cambia con le nuove regole di Cloudflare.",
"inLanguage": "it",
"url": "https://geosnap.ai/blog/il-tuo-sito-blocca-chatgpt-guida-crawler-ai",
"mainEntityOfPage": "https://geosnap.ai/blog/il-tuo-sito-blocca-chatgpt-guida-crawler-ai",
"image": "https://geosnap.ai/img/blog/p2026-10-05-crawler-ai.webp",
"articleSection": "Guide",
"wordCount": 969,
"author": {
"@type": "Person",
"name": "Rinald Sefa",
"jobTitle": "CMO",
"url": "https://geosnap.ai/about",
"worksFor": {
"@id": "https://geosnap.ai/#organization"
}
},
"publisher": {
"@id": "https://geosnap.ai/#organization"
},
"isAccessibleForFree": true,
"abstract": "ChatGPT, Claude e Perplexity possono citarti solo se i loro crawler di ricerca leggono il tuo sito. Puoi bloccare l'addestramento dei modelli e restare citabile, ma devi distinguere i crawler giusti nel robots.txt e controllare anche CDN e firewall, a partire dalle nuove impostazioni di Cloudflare del 15 settembre 2026.",
"datePublished": "2026-10-05",
"dateModified": "2026-10-05",
"citation": [
"https://developers.openai.com/api/docs/bots",
"https://support.claude.com/en/articles/8896518-what-is-claudebot",
"https://docs.perplexity.ai/guides/bots",
"https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers",
"https://blog.cloudflare.com/content-independence-day-ai-options/",
"https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/",
"https://vercel.com/blog/the-rise-of-the-ai-crawler"
],
"workTranslation": {
"@id": "https://geosnap.ai/en/blog/il-tuo-sito-blocca-chatgpt-guida-crawler-ai#article"
}
}
FAQPage descrive le domande frequenti
{
"@context": "https://schema.org",
"@type": "FAQPage",
"@id": "https://geosnap.ai/blog/il-tuo-sito-blocca-chatgpt-guida-crawler-ai#faq",
"mainEntity": [
{
"@type": "Question",
"name": "Se blocco GPTBot, il mio sito sparisce da ChatGPT?",
"acceptedAnswer": {
"@type": "Answer",
"text": "No. GPTBot raccoglie contenuti per addestrare i modelli. Per comparire nelle risposte della ricerca di ChatGPT conta OAI-SearchBot: se lo lasci entrare, il sito resta citabile anche con GPTBot bloccato."
}
},
{
"@type": "Question",
"name": "Bloccare Google-Extended penalizza il posizionamento su Google?",
"acceptedAnswer": {
"@type": "Answer",
"text": "Secondo Google no: Google-Extended non influisce sull'inclusione nella Ricerca Google né sul posizionamento. Riguarda l'uso dei contenuti per addestrare Gemini e per il grounding."
}
},
{
"@type": "Question",
"name": "Quanto tempo serve perché una modifica al robots.txt abbia effetto?",
"acceptedAnswer": {
"@type": "Answer",
"text": "OpenAI indica circa 24 ore per i suoi sistemi. Gli altri fornitori non danno tempi precisi: ricontrolla dopo qualche giorno, anche nei log del server."
}
},
{
"@type": "Question",
"name": "Il robots.txt basta per bloccare tutti i crawler AI?",
"acceptedAnswer": {
"@type": "Answer",
"text": "No. I crawler che agiscono su richiesta di un utente, come Perplexity-User, possono non rispettarlo. Per un controllo più rigido servono le regole del CDN o del firewall, da usare con attenzione per non bloccare anche i crawler di ricerca."
}
}
]
}
Metadati
Le informazioni nell'intestazione della pagina, che crawler e motori leggono prima del contenuto.