NEWWorld's first AI visibility audit tool for Web3 is live.Run free audit →
Standards · 9 min read · Published 2026-05-14

llms.txt vs robots.txt: o que os sites crypto precisam em 2026

Dois arquivos de texto na raiz do seu domínio fazem trabalhos diferentes. O robots.txt existe desde 1994 e controla o acesso de crawlers. O llms.txt é novo em 2024 e diz aos mecanismos de IA do que se trata o seu site. Você precisa dos dois. A maioria dos sites crypto não tem nenhum configurado corretamente.

Chapter 01
// Definitions

O que cada arquivo realmente faz

robots.txt: a directive file that tells crawlers (search engines, AI bots, archivers) which paths they can fetch. It's a politeness protocol (crawlers respect it voluntarily). Hard-coded user-agent allow/disallow rules. Both Google and OpenAI publicly commit to respecting it.

llms.txt: a structured Markdown file that explains your site to AI engines. Like a sitemap, but human-readable and AI-targeted. Lists key pages, describes the product, links to canonical resources. Standard proposed by Anthropic and Jeremy Howard in 2024.

Eles servem a camadas diferentes. O robots.txt controla o acesso. O llms.txt fornece contexto. Você precisa do acesso controlado corretamente E do contexto fornecido de forma limpa. Pular qualquer um deles custa visibilidade AEO.

Chapter 02
// robots.txt

Allowlist de bots de IA no robots.txt

Por padrão, a maioria dos CMSs envia um robots.txt que bloqueia bots de IA sem querer ou nem trata do assunto. Adicione diretivas Allow explícitas para os bots pelos quais você quer ser indexado.

# AI Crawlers (explicit allow)
User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Google-Extended
Allow: /

A lista acima é o conjunto mínimo viável para sites crypto do mercado de língua inglesa em 2026. Adicione Bytespider (o crawler do TikTok), Amazonbot e Applebot-Extended se você atende públicos que usam os recursos de IA dessas plataformas.

Não bloqueie bots de IA com a suposição de que 'training data' é uma preocupação. Os crawlers que buscam conteúdo para citações em tempo real (PerplexityBot, ChatGPT-User, OAI-SearchBot) NÃO são os mesmos que os crawlers de treinamento (GPTBot, ClaudeBot). Bloquear os crawlers de citação te torna invisível para os mecanismos de IA. Bloquear os crawlers de treinamento é uma decisão sua porém não afeta as citações.

Chapter 03
// llms.txt

Estrutura e conteúdo do llms.txt

O llms.txt é Markdown puro na raiz: https://yoursite.com/llms.txt. A estrutura segue a proposta: H1 com o nome do site, blockquote com descrição de um parágrafo, depois seções de links.

# Your Protocol

> Your Protocol is a decentralized lending platform with $200M+ TVL across 5 chains. We pioneered isolation mode for risky assets.

## Core product

- [Supply markets](https://yourprotocol.com/markets/): list of all supplied assets with current APYs
- [Borrow markets](https://yourprotocol.com/borrow/): borrowing rates and collateral requirements
- [Documentation](https://docs.yourprotocol.com/): technical docs and integration guides

## Key topics

- [What is isolation mode](https://yourprotocol.com/blog/isolation-mode/)
- [How our oracle works](https://yourprotocol.com/blog/oracle-design/)
- [Segurança audits](https://yourprotocol.com/security/)

Arquivo complementar: llms-full.txt na mesma raiz. Essa é a versão long-form com o texto completo das suas páginas principais embutido. Os mecanismos de IA que seguem a spec podem buscar o llms.txt para o índice ou o llms-full.txt para conteúdo direto. Hospedamos o llms-full.txt com 14KB para a Crawlux, pequeno o suficiente para um mecanismo recuperar por completo.

Chapter 04
// Crypto rules

Considerações específicas para crypto

Dois padrões específicos para sites crypto.

Pattern 1: declare your token contract. If you have a token, the llms.txt should link to a canonical token page with the contract address. AI engines pull this when answering 'what's the contract address for <TOKEN>.' Without it, the engine guesses based on Etherscan results, and guesses wrong on tokens with multiple deployments.

Pattern 2: declare your supported chains. Crypto-specific queries ('does <protocol> support Solana') are frequent. List the supported chains explicitly in llms.txt as a section. Take this from your llms-full.txt content.

The robots.txt for a crypto site should also block /audit-report/, /checkout/, and any URL with a wallet address as a parameter. Wallet-addressed URLs leak user data into search indices.

Chapter 05
// Testing

Validação e monitoramento

robots.txt validators. Google Search Console > Settings > robots.txt Tester. Paste a URL and confirm it's not accidentally blocked.

llms.txt validators. The community-maintained validator at llmstxt.org. Checks the structure follows the spec.

Live test. Ask ChatGPT 'what does <your site> do' two weeks after deploying llms.txt. If the answer quotes the description from your llms.txt, the file is being read. If the answer paraphrases your homepage h1, the engine hasn't picked it up yet.

Server log monitoring. Filter your access logs for User-Agent strings containing GPTBot, ClaudeBot, PerplexityBot. You should see hits within 48 hours of deploying llms.txt. No hits after a week suggests the file isn't reachable or your CDN is blocking the bots.

Perguntas frequentes
// Perguntas frequentes

Perguntas comuns

Is llms.txt required?

Não. É um padrão emergente, não uma obrigação. Sites sem ele ainda podem ser citados. Sites com ele são citados de forma consistente em taxas mais altas em nossos testes.

Do all AI engines respect llms.txt?

A Anthropic oferece suporte explícito. A OpenAI não se comprometeu formalmente mas já foi observada lendo o arquivo. O Google AI Overviews não confirmou suporte. Trate isso como best-effort, sem garantia.

Can I have llms.txt without robots.txt?

Não faça isso. O robots.txt é obrigatório para qualquer site bem formado. O llms.txt é complementar.

How often should I update llms.txt?

Quando você lança uma feature ou página importante nova. Fora isso trimestralmente. Mantenha abaixo de 16KB para que os mecanismos consigam recuperar em uma única solicitação.

Will llms.txt hurt my Google SEO?

Não. O Google ignora o llms.txt. É puramente um sinal para os mecanismos de IA.

Audite seu site crypto em 60 segundos

Scan profundo de 8 módulos. Visibilidade de IA, schema, SEO técnico, backlinks. Um domínio grátis para sempre.