Quando OpenAI ha annunciato GPTBot nel 2023, molti siti hanno preso paura e bloccato. Era la decisione sbagliata. Vediamo cosa fare adesso.
I bot AI principali
Sette bot AI da considerare nel robots.txt:
- GPTBot (OpenAI): per il training del prossimo modello.
- ChatGPT-User (OpenAI): per il browse di ChatGPT Plus.
- ClaudeBot / Claude-Web (Anthropic): training + browse.
- PerplexityBot (Perplexity): retrieval RAG.
- Google-Extended (Google): training di Gemini.
- Applebot-Extended (Apple): training di Apple Intelligence.
- CCBot (Common Crawl): infrastruttura usata per training di molti modelli.
La regola generale: permetti tutti
Per la maggior parte dei siti commerciali, permettere tutti i bot AI è la scelta giusta. Tre ragioni:
- Bloccare = invisibilità. Se non lasci entrare GPTBot, ChatGPT non potrà citarti nel prossimo aggiornamento del modello.
- Il traffico organico AI è già qui. I LLM stanno generando traffico verso siti che permettono retrieval.
- Il rischio “ti rubano i contenuti” è esagerato. I LLM imparano stili e fatti, non riproducono testo letterale.
Le eccezioni
Casi in cui ha senso bloccare alcuni bot:
- Contenuti premium dietro paywall: blocca tutti gli AI bot dalle pagine paywallate.
- Database proprietari: blocca i path API o dump database.
- Contenuti sensibili o legali: dove il rischio reputazionale è alto.
- Editori news con accordi commerciali con AI vendor: alcuni hanno deal di licensing.
Il robots.txt che uso, esempio
User-agent: *
Allow: /
User-agent: GPTBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: Claude-Web
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Allow: /
User-agent: Applebot-Extended
Allow: /
User-agent: CCBot
Allow: /
Sitemap: https://sito.it/sitemap-index.xml
Esplicito è meglio di implicito. Anche se User-agent: * già permetterebbe tutti, dichiarare esplicitamente i bot AI segnala “li voglio”.
Cosa NON serve fare
- Aggiungere “ai-policies.txt”: non è ancora standard.
- Meta tag “no-ai-training”: non rispettato in modo coerente.
- Iscriversi a registri privati AI: marketing degli ultimi 12 mesi, poco effetto pratico.
E se cambi idea?
Permettere oggi e bloccare domani è fattibile: aggiorni il robots.txt, i bot smettono di crawlare. Bloccare oggi e permettere domani: i contenuti devono ri-crawlare, ci vogliono settimane prima che ricomincino a citarti.
Asimmetria a favore del permettere.
Per audit del robots.txt + llms.txt, l’audit LLMO completo ha una sezione dedicata.