Técnico · 4 min
robots.txt para IAs · cómo permitir GPTBot, ClaudeBot, PerplexityBot
Si tu robots.txt bloquea a los crawlers de IA (a veces por defecto), no importa cuánto AEO hagas: ninguna IA va a encontrarte.
Los crawlers de IA que importan hoy
- GPTBot — OpenAI, para ChatGPT y Copilot enterprise.
- ChatGPT-User — cuando ChatGPT hace live browsing.
- OAI-SearchBot — el nuevo bot del search de OpenAI.
- ClaudeBot — Anthropic, entrenamiento.
- Claude-Web — cuando Claude hace live web.
- PerplexityBot — Perplexity search.
- Perplexity-User — live browsing de Perplexity.
- Google-Extended — controla si Gemini usa tu contenido.
- CCBot — Common Crawl (base de muchos LLMs).
- Applebot-Extended — Apple Intelligence.
Plantilla mínima recomendada
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /panel/
Disallow: /api/
# AEO crawlers — bienvenidos explícitamente
User-agent: GPTBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: Claude-Web
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Perplexity-User
Allow: /
User-agent: Google-Extended
Allow: /
User-agent: Applebot-Extended
Allow: /
User-agent: CCBot
Allow: /
Sitemap: https://tunegocio.com/sitemap.xml Errores que hunden tu AEO
Disallow: /global para User-agent: *. Suena obvio pero pasa cuando migras hostings.- WordPress con plugin de "SEO" que bloquea GPTBot por defecto.
- Cloudflare con "Bot Fight Mode" agresivo que devuelve 403 a los crawlers IA.
- robots.txt en un subdominio distinto al que quieres crawlear.
Cómo verificar que sí funciona
curl -A "GPTBot" -I https://tunegocio.com/ Si devuelve 200 OK, GPTBot te puede leer. Si devuelve 403 o error, tienes un bloqueador en algún lugar del stack.
¿Y si NO quiero que las IAs se entrenen con mi contenido?
Puedes bloquear entrenamiento y permitir búsqueda por separado. GPTBot es para training; ChatGPT-User es para live browsing. Bloquea el primero, permite el segundo. Similar para Claude y otros.