NUEVOYa está disponible la primera herramienta de auditoría de visibilidad en IA para Web3 del mundo.Haz una auditoría gratis →
Estándares · 9 min de lectura · Publicado el 2026-05-14

llms.txt vs robots.txt: lo que los sitios crypto necesitan en 2026

Dos archivos de texto en el root de tu dominio hacen trabajos diferentes. robots.txt ha existido desde 1994 y controla el acceso de crawlers. llms.txt es nuevo en 2024 y le dice a los motores IA de qué se trata tu sitio. Necesitas ambos. La mayoría de los sitios crypto no tienen ninguno configurado correctamente.

Capítulo 01
// Definiciones

Qué hace realmente cada archivo

robots.txt: un archivo de directivas que indica a los crawlers (motores de búsqueda, bots de IA, archivadores) qué rutas pueden rastrear. Es un protocolo de cortesía — los crawlers lo respetan voluntariamente. Reglas fijas de allow/disallow por user-agent. Tanto Google como OpenAI se comprometen públicamente a respetarlo.

llms.txt: un archivo Markdown estructurado que explica tu sitio a los motores de IA. Como un sitemap, pero legible para humanos y orientado a la IA. Enumera las páginas clave, describe el producto, enlaza a recursos canónicos. Estándar propuesto por Anthropic y Jeremy Howard en 2024.

Sirven a capas diferentes. robots.txt controla acceso. llms.txt proporciona contexto. Necesitas el acceso controlado correctamente Y el contexto proporcionado limpiamente. Saltarte cualquiera cuesta visibilidad AEO.

Capítulo 02
// robots.txt

Allowlist de bots IA en robots.txt

Por default, la mayoría de los CMSs envían un robots.txt que bloquea bots IA inadvertidamente o no los aborda en absoluto. Añade directivas Allow explícitas para los bots por los cuales quieres ser indexado.

# AI Crawlers (explicit allow)
User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Google-Extended
Allow: /

La lista arriba es el set viable mínimo para sitios crypto del mercado inglés en 2026. Añade Bytespider (el crawler de TikTok), Amazonbot y Applebot-Extended si sirves audiencias usando las features IA de esas plataformas.

No bloquees bots IA con el supuesto que 'training data' es una preocupación. Los crawlers que jalan contenido para citas en tiempo real (PerplexityBot, ChatGPT-User, OAI-SearchBot) NO son los mismos que los crawlers de entrenamiento (GPTBot, ClaudeBot). Bloquear los crawlers de citas te hace invisible para los motores IA. Bloquear los crawlers de entrenamiento es tu llamada pero no afecta las citas.

Capítulo 03
// llms.txt

Estructura y contenido de llms.txt

llms.txt es Markdown plano en el root: https://yoursite.com/llms.txt. La estructura sigue la propuesta: H1 con nombre del sitio, blockquote con descripción de un párrafo, luego secciones de enlaces.

# Your Protocol

> Your Protocol is a decentralized lending platform with $200M+ TVL across 5 chains. We pioneered isolation mode for risky assets.

## Core product

- [Supply markets](https://yourprotocol.com/markets/): list of all supplied assets with current APYs
- [Borrow markets](https://yourprotocol.com/borrow/): borrowing rates and collateral requirements
- [Documentation](https://docs.yourprotocol.com/): technical docs and integration guides

## Key topics

- [What is isolation mode](https://yourprotocol.com/blog/isolation-mode/)
- [How our oracle works](https://yourprotocol.com/blog/oracle-design/)
- [Seguridad audits](https://yourprotocol.com/security/)

Archivo compañero: llms-full.txt en el mismo root. Esta es la versión long-form con el texto completo de tus páginas clave inlineado. Los motores IA que siguen la spec pueden jalar o llms.txt para el index o llms-full.txt para contenido directo. Hosteamos llms-full.txt a 14KB para Crawlux, suficientemente pequeño para que un motor lo recupere completamente.

Capítulo 04
// Crypto rules

Consideraciones crypto-específicas

Dos patrones específicos a sitios crypto.

Patrón 1: declara el contrato de tu token. Si tienes un token, el llms.txt debe enlazar a una página canónica del token con la dirección del contrato. Los motores de IA toman esto al responder 'cuál es la dirección del contrato de <TOKEN>.' Sin ella, el motor adivina basándose en resultados de Etherscan, y se equivoca con tokens que tienen múltiples despliegues.

Patrón 2: declara las cadenas compatibles. Las consultas específicas de cripto ('¿<protocol> soporta Solana?') son frecuentes. Lista explícitamente las chains soportadas en llms.txt como una sección. Tómalo del contenido de tu llms-full.txt.

El robots.txt de un sitio cripto también debería bloquear /audit-report/, /checkout/, y cualquier URL con una dirección de wallet como parámetro. Las URLs con direcciones de wallet filtran datos de usuarios en los índices de búsqueda.

Capítulo 05
// Pruebas

Validación y monitoreo

robots.txt validators. Google Search Console > Configuración > Probador de robots.txt. Pega una URL y confirma que no esté bloqueada por accidente.

llms.txt validators. El validador mantenido por la comunidad en llmstxt.org. Verifica que la estructura siga la especificación.

Live test. Pregunta a ChatGPT 'qué hace <tu sitio>' dos semanas después de publicar llms.txt. Si la respuesta cita la description de tu llms.txt, el archivo se está leyendo. Si la respuesta parafrasea el h1 de tu homepage, el motor todavía no lo ha detectado.

Monitoreo de logs del servidor. Filtra tus logs de acceso por strings de User-Agent que contengan GPTBot, ClaudeBot, PerplexityBot. Deberías ver hits dentro de las 48 horas posteriores a desplegar llms.txt. Si no hay hits después de una semana, el archivo no es accesible o tu CDN está bloqueando a los bots.

Preguntas frecuentes
// Preguntas frecuentes

Preguntas comunes

¿Es obligatorio llms.txt?

No. Es un estándar emergente, no un mandato. Los sitios sin él todavía pueden ser citados. Los sitios con él consistentemente son citados a tasas más altas en nuestras pruebas.

¿Todos los motores de IA respetan llms.txt?

Anthropic lo soporta explícitamente. OpenAI no se ha comprometido formalmente pero se le ha observado leyéndolo. Google AI Overviews no ha confirmado soporte. Trátalo como best-effort, no garantizado.

¿Puedo tener llms.txt sin robots.txt?

No lo hagas. robots.txt es requerido para cualquier sitio bien formado. llms.txt es suplementario.

¿Cada cuánto debo actualizar llms.txt?

Cuando lanzas una feature o página mayor nueva. De otro modo trimestralmente. Mantenlo bajo 16KB para que los motores lo recuperen en una solicitud.

¿llms.txt perjudicará mi SEO en Google?

No. Google ignora llms.txt. Es puramente una señal a los motores IA.

Audita tu sitio crypto en 60 segundos

Scan profundo de 8 módulos. Visibilidad IA, schema, SEO técnico, backlinks. Un dominio gratis para siempre.