llms.txt: el robots.txt de la era IA
Treinta años después de robots.txt, surge un nuevo archivo con la misma lógica: llms.txt. Para qué sirve, cómo redactarlo, y por qué su coherencia con robots.txt es decisiva.
En 1994, los responsables de los sitios web empezaron a colocar un archivo robots.txt en la raíz de su dominio. Este archivo indicaba a los crawlers web qué indexar y qué ignorar. Nadie los obligó. Se convirtió en un estándar universal porque respondía a una necesidad real: dar a los robots las instrucciones necesarias para hacer bien su trabajo.
Treinta años después, surge un nuevo archivo con la misma lógica: llms.txt.
¿Su función? Dar a los modelos de lenguaje la información esencial sobre vuestro sitio, estructurada de forma que puedan procesarla eficazmente, sin tener que deducir ellos mismos lo que importa.
Qué hace llms.txt
El archivo llms.txt se coloca en la raíz de un dominio, igual que robots.txt. Contiene una descripción estructurada del sitio — en markdown, legible por los LLM — con la información clave sobre la entidad, sus productos, sus valores, sus fuentes de confianza, sus páginas estratégicas.
En concreto, puede incluir:
- Qué hace la empresa, en una frase precisa
- Los productos o servicios principales y sus características
- El público objetivo
- Las páginas más importantes que conocer
- Los autores o expertos asociados al sitio
- Enlaces a las fuentes que hablan del sitio (prensa, estudios, comparativas)
El principio: en lugar de dejar que un LLM reconstruya una imagen incompleta o distorsionada de vuestra marca a partir de fragmentos dispersos, le proporcionáis una base de información estructurada, verificable y coherente.
Por qué importa en GEO
Los LLM tienen dos formas de conocer una marca.
La primera es el entrenamiento. Todo lo que se ha asimilado antes del cutoff de conocimiento del modelo. Ahí viven las marcas conocidas, los hechos establecidos, la información repetida en numerosas fuentes. Para las marcas recientes, de nicho o poco representadas online, esta capa es parcial o inexacta.
La segunda es la búsqueda en tiempo real. Cuando el modelo tiene acceso a herramientas de búsqueda, va a buscar información actualizada. Y lo que encuentra primero son las fuentes mejor estructuradas y más fáciles de analizar.
llms.txt actúa en ambos niveles. Mejora la calidad de la información disponible para el modelo en tiempo real, y estructura esa información de forma que maximiza la probabilidad de que el modelo la utilice en sus respuestas.
Lo que hace (o no hace) un llms.txt mal redactado
Un llms.txt vacío o genérico es una oportunidad perdida. Un llms.txt generado automáticamente sin calibrar es a veces peor — puede contener descripciones difusas que refuerzan una imagen inexacta.
Los errores frecuentes:
Descripción demasiado vaga. "Empresa innovadora en el sector digital" no le dice nada a un LLM. "Plataforma GEO que monitoriza las citas de marca en ChatGPT, Gemini y Perplexity y recomienda acciones de contenido basadas en las fan-out queries" dice mucho.
Ausencia de entidades nombradas. Los LLM funcionan a partir de entidades — nombres, productos, tecnologías, lugares, personas. Un llms.txt sin entidades claras es poco útil.
Fuentes de terceros olvidadas. Señalar artículos de prensa, comparativas y estudios que mencionan vuestra marca refuerza la credibilidad de la información a ojos del modelo.
Falta de alineación con el resto del contenido del sitio. Si el llms.txt dice una cosa y las páginas del sitio dicen otra, el modelo arbitra según las señales más fuertes — no necesariamente a vuestro favor.
robots.txt contradictorio. Bloquear los crawlers de IA en robots.txt mientras se mantiene un llms.txt es incoherente. Ambos archivos deben estar alineados.
llms.txt y robots.txt: la coherencia como condición
El llms.txt no funciona de forma aislada. Se articula con robots.txt, con los datos estructurados Schema.org, con la calidad general del contenido del sitio.
La coherencia entre robots.txt y llms.txt es un punto que se descuida a menudo. Algunos sitios bloquean los crawlers de IA en robots.txt por reflejo de protección de datos, sin darse cuenta de que esto neutraliza por completo el efecto del llms.txt. Otros permiten el rastreo pero tienen un llms.txt que contradice sus páginas de producto.
Vurto incluye un módulo de auditoría y reescritura de ambos archivos a la vez — robots.txt y llms.txt — para garantizar que las instrucciones dadas a los modelos sean coherentes, completas y estén alineadas con la estrategia GEO global. Es uno de los puntos de partida de toda auditoría GEO seria.
Cómo redactar un llms.txt eficaz
La estructura recomendada es sencilla:
# [Nombre de la empresa]
[Descripción precisa en 2-3 frases: qué hacéis, para quién, con qué diferencia]
## Productos / Servicios
- [Producto 1]: [descripción funcional en una frase]
- [Producto 2]: [descripción funcional en una frase]
## Público objetivo
[Descripción del público principal: sector, tamaño, rol, problema resuelto]
## Páginas clave
- [URL página 1]: [qué se encuentra ahí]
- [URL página 2]: [qué se encuentra ahí]
## Fuentes de referencia
- [Enlace artículo de prensa]
- [Enlace comparativa]
- [Enlace estudio que cita la marca]
No es un formato grabado en piedra — el estándar evoluciona rápido. Pero la lógica de fondo es estable: información precisa, entidades nombradas, enlaces a fuentes de terceros, coherencia con el resto del sitio.
El estado del mercado en 2026
La adopción de llms.txt avanza. Entre los sitios más avanzados en GEO, se ha convertido en un reflejo básico, al mismo nivel que robots.txt o el sitemap.
Para las marcas que aún no lo tienen, es una de las acciones GEO con mejor relación esfuerzo/impacto. Unas horas de trabajo, un archivo bien redactado, una coherencia verificada con robots.txt — y dais a los LLM una base de información fiable sobre vuestra marca que antes no tenían.
En un mundo donde los motores generativos construyen su respuesta a partir de las señales disponibles, controlar esas señales en origen es una forma básica de higiene digital.
Vurto audita y reescribe los archivos llms.txt y robots.txt para garantizar su coherencia y maximizar la legibilidad de vuestro sitio para los LLM.