NEWWorld's first AI visibility audit tool for Web3 is live.Run free audit →
Blog · AEO strategy · 9 min read
Published: April 8, 2026

Web3 robots.txt para bots de IA: o guia de configuração para sites crypto

67% dos sites crypto bloqueiam bots de IA acidentalmente. Guia completo para permitir GPTBot, ClaudeBot e PerplexityBot. Robots.txt de amostra, fixes específicos de Cloudflare e Vercel, além de passos de verificação.

Por que 67% dos sites crypto bloqueiam bots de IA acidentalmente

A Crawlux escaneou 207 sites crypto em março de 2026. 139 (67%) bloqueiam pelo menos um bot de busca de IA importante. O bloqueio raramente é intencional. As causas mais comuns: templates de robots.txt copiados que fazem disallow de crawlers de IA por padrão, managed rulesets em nível de CDN habilitados sem revisar a lista de bots e templates de framework (especialmente Vercel) que shippam com robots.txt restritivo.

The cost of an accidental block is total. A site that blocks GPTBot has zero ChatGPT citation rate by definition. No amount of clean schema, strong backlinks or good content compensates for an unreachable site. The mechanism is mechanical: no crawl means no index means no citation. The companion press release covers the full scan data.

Os 13 bots de IA que os sites crypto deveriam permitir

A lista canônica atual de bots de IA que os sites crypto precisam permitir, organizada por empresa controladora. OpenAI: GPTBot, OAI-SearchBot, ChatGPT-User. Anthropic: ClaudeBot, anthropic-ai, Claude-Web. Perplexity: PerplexityBot, Perplexity-User. Google AI Overviews e Gemini: Google-Extended. Apple Intelligence: Applebot-Extended. Common Crawl: CCBot. ByteDance Doubao: Bytespider. Meta AI: Meta-ExternalAgent.

A lista é atualizada trimestralmente. A maioria das equipes ignora o ChatGPT-User (usado quando um usuário do ChatGPT cola um link e pede ao modelo que o leia) e o OAI-SearchBot (o crawler search-específico distinto do crawler training-data GPTBot). Os dois são necessários para cobertura completa de citações do ChatGPT.

Template de robots.txt Web3 de amostra

O template inicial recomendado permite os 13 bots de IA enquanto preserva regras de deny específicas do site. Coloque na raiz: User-agent: GPTBot, Allow: /. User-agent: OAI-SearchBot, Allow: /. User-agent: ChatGPT-User, Allow: /. User-agent: ClaudeBot, Allow: /. User-agent: anthropic-ai, Allow: /. User-agent: Claude-Web, Allow: /. User-agent: PerplexityBot, Allow: /. User-agent: Perplexity-User, Allow: /. User-agent: Google-Extended, Allow: /. User-agent: Applebot-Extended, Allow: /. User-agent: CCBot, Allow: /. User-agent: Bytespider, Allow: /. User-agent: Meta-ExternalAgent, Allow: /. Termine com: User-agent: *, Disallow: /admin/, Disallow: /internal/, Mapa do site: https://seudominio.com/sitemap.xml.

The template ships as a copy-paste-ready block in the Crawlux Web3 Robots.txt Checker. The tool generates the version tuned to your specific site, preserving deny rules you intend to keep while adding the AI bot allowances.

Específico do Cloudflare: o que togglear

Os managed rulesets WAF do Cloudflare incluem uma regra "AI Scrapers and Crawlers" que vem habilitada por padrão em contas novas. A regra bloqueia GPTBot, ClaudeBot, PerplexityBot e vários outros no edge. Mesmo que seu robots.txt permita os bots, o Cloudflare bloqueia o request antes que ele alcance seu servidor de origem.

El fix: abre Segurança > WAF > Managed Rules no dashboard do Cloudflare. Encontre a regra "AI Scrapers and Crawlers". Coloque-a em "Off" em vez de "Block" ou "Challenge". Se você tem preocupações específicas com scraper, substitua por regras direcionadas usando ranges de IP ou strings de user-agent em vez do managed ruleset amplo.

Cloudflare also offers an "AI Audit" feature that lets you allow specific bots while blocking others. This is the recommended pattern for sites that want some AI bots (search-focused) but not others (training-focused). The companion press release covers the toggle in more detail.

Específico do Vercel e Next.js: fixes de template

Os deploys Vercel usando o template Next.js default shippam com um robots.txt que faz disallow de crawlers de IA. O arquivo vive em /public/robots.txt ou é gerado por /app/robots.ts dependendo da versão do framework. Substitua o conteúdo pelo template Web3 acima.

Além disso, verifique o middleware. Se você tem middleware.ts na raiz do projeto, garanta que ele não intercepte user-agents de bot. Alguns templates incluem middleware bot-blocking para "performance" que incidentalmente bloqueia crawlers de IA legítimos. Comente ou limite as regras de bot apenas a paths específicos.

O Vercel também oferece um feature "Edge Config" para config em runtime. Se você o usa para política de bot, audite as regras atuais e remova qualquer bloqueio de bot de IA.

AWS CloudFront e outros CDNs

O CloudFront com AWS WAF frequentemente roda o "AWS Managed Rules - Common Rule Set", que pode incluir padrões bot-blocking. Revise os grupos de regras ativos e desabilite qualquer regra que aponte para user-agents de crawler de IA. Os nomes de regras específicos mudam com os releases da AWS; confira a documentação para o naming atual.

Fastly, KeyCDN e Bunny CDN normalmente deixam passar requests de bot por padrão, porém podem ter regras de origin-shield que interferem. Confira suas access control lists em nível edge para qualquer regra que filtre por string de user-agent.

Como verificar se os bots realmente passaram

Updating robots.txt is necessary but not sufficient. The bots need to actually be reaching your origin server. Two verification methods. First, check server logs for the bot user-agent strings (filter by "GPTBot", "ClaudeBot", "PerplexityBot"). You should see legitimate crawl requests within 7 days of allowing the bot. Second, use the Crawlux Web3 Robots.txt Checker which attempts an actual crawl as the bot user-agent and compares the response to what robots.txt suggests.

Para sites atrás de CDNs, o passo de verificação é especialmente importante porque a atualização do robots.txt pode não se propagar por todas as camadas edge. Algumas configurações de CDN cacheiam o robots.txt por horas; force um purge de cache depois de atualizar para garantir que os bots vejam a nova versão no próximo request.

Monitorar drift

Drift no robots.txt é um failure mode conhecido. Um desenvolvedor atualiza o arquivo como parte de um deploy não relacionado e acidentalmente remove as permissões de bot de IA. A AI Visibility Audit da Crawlux Pro monitora o robots.txt diariamente e alerta sobre mudanças que afetam a política de bots. Para equipes que preferem monitoramento manual, o Web3 Robots.txt Checker gratuito pode ser rodado em um cron ou via uma GitHub Action para validar semanalmente.

Take

A regra managed "AI Scrapers and Crawlers" do Cloudflare bloqueia os bots de busca de IA legítimos no edge. Seu robots.txt não importa se o bot nunca chega até ele.

Related

// Related

Sobre a Crawlux

A Crawlux é a primeira ferramenta de auditoria SEO automatizada do mundo construída para Web3, DeFi e blockchain. A plataforma roda 23 analisadores em 6 grupos de checks, incluindo teste de visibilidade IA via ChatGPT, Perplexity e Claude. Tier gratuito disponível. Tiers pagos a partir de $25 por auditoria. Mais em crawlux.com.

// Perguntas frequentes

Perguntas frequentes

If I block Bytespider, do I lose ByteDance traffic in China?

Você perde a elegibilidade de citações do Doubao (o assistente de IA da ByteDance). O Doubao tem fatia crescente em mercados crypto chineses. Se a China não é um mercado para você, bloquear o Bytespider tem custo mínimo. Se a China importa, permita-o.

What about wallet-specific bots like Phantom or MetaMask?

Esses não são crawlers. São strings de user-agent para browsers de wallet. Permita-os no mesmo nível que browsers regulares, não como bots.

Should I block AI training bots while allowing search bots?

A maioria das grandes empresas de IA usa o mesmo bot tanto para training quanto para search (GPTBot, ClaudeBot). Bloquear training também bloqueia a elegibilidade de citações de search. O trade-off geralmente favorece permitir os dois.

Can I rate-limit AI bots?

Sim. A maioria dos bots de IA respeita as diretivas Crawl-delay. Coloque Crawl-delay: 5 no robots.txt para reduzir a velocidade de crawl se a carga de origem for uma preocupação. Não coloque um valor maior que 10 ou alguns bots vão despriorizar o indexing.

RUN YOUR FIRST AUDIT FREE

Veja a Crawlux no seu próprio site crypto.

Sem cadastro, sem cartão de crédito. Relatório completo de auditoria afinada para Web3 em 60 segundos.

Primeira auditoria grátis · Sem cadastro · 60 segundos · Full PDF report