llms.txt: qué es y cómo escribir uno
Por Zakaria Reziki
CEO — Growli · 15 de agosto de 2026 · 9 min de lectura
Redactado con ayuda de IA siguiendo los estándares editoriales de Zakaria Reziki, y publicado tras controles automáticos de fuentes y calidad.
llms.txt es una convención propuesta: un archivo Markdown publicado en la raíz de tu dominio (example.com/llms.txt) que ofrece a los grandes modelos de lenguaje un mapa breve y curado de tus páginas más útiles, en un formato que pueden leer sin abrirse paso entre navegación, scripts y relleno. Lo presentó Jeremy Howard, de Answer.AI, en septiembre de 2024 y está documentado en llmstxt.org.
Hay dos verdades simultáneas, y la mayoría de artículos sobre el tema solo cuentan la primera. El archivo es genuinamente útil si mantienes documentación, una referencia de API o una base de conocimiento que los agentes deben leer. Y no es un estándar adoptado: Google ha dicho que no lo usa en Search, y no nos consta que ningún fabricante de asistentes haya documentado llms.txt como entrada para descubrir, ordenar o citar páginas.
Esta guía cubre la especificación tal y como está escrita, un ejemplo real (nuestro propio archivo) y el lugar que ocupa respecto a robots.txt y los datos estructurados, para que dediques los veinte minutos que cuesta, entiendas qué obtienes y no lo confundas con una estrategia de visibilidad en IA.
Qué dice realmente la propuesta
El problema para el que se diseñó llms.txt es el contexto, no el rastreo. Cuando un modelo o un agente necesita responder una pregunta usando tu sitio, tiene una ventana de contexto limitada y una entrada hostil: páginas HTML llenas de navegación, avisos de cookies, barras laterales, anuncios y contenido renderizado con JavaScript. Convertir un sitio grande en algo sobre lo que un modelo pueda razonar es costoso y se pierde información por el camino.
La especificación de llms.txt propone dos soluciones complementarias. La primera, un único archivo Markdown en /llms.txt que actúa como índice curado: esto es el proyecto, estas son las páginas que importan, por orden de prioridad. La segunda, publicar versiones limpias en Markdown de cada página en URL predecibles (una página en /docs/setup disponible también en /docs/setup.md), de modo que cuando el agente haya elegido un enlace de tu índice pueda descargar texto en lugar de una plantilla.
Fíjate en lo que no es. No contiene directivas, ni reglas de allow o disallow, ni permisos. Es una lista de lectura que ofreces, y cualquier consumidor es libre de ignorarla. La especificación usa Markdown a propósito, en lugar de JSON o XML, precisamente porque el consumidor previsto es un modelo de lenguaje y porque las personas tienen que poder mantenerlo a mano.
- Cuál es la adopción real
- paragraphs
- bullets
Cuál es la adopción real
Desconfía de quien afirme que llms.txt ya es un factor de posicionamiento. John Mueller, de Google, lo ha comparado públicamente con la vieja metaetiqueta keywords y ha afirmado que Google no lo usa en Search; puedes encontrar la cobertura en Search Engine Roundtable. La propia documentación de rastreo e indexación de Google no menciona el archivo; el que sí documenta para el control de rastreadores es robots.txt.
Del lado del consumidor, la posición honesta es que ningún fabricante de asistentes relevante ha publicado documentación que diga que su rastreador o su capa de recuperación usa /llms.txt para decidir qué descargar o citar. Donde sí se usa de forma demostrable es en el sentido contrario: los desarrolladores pegan la URL de un llms.txt en un chat o apuntan a ella con un agente de programación, y el agente sigue los enlaces. Ese flujo de trabajo es real, y es para el que se escribió la especificación.
La adopción del lado del editor se ve sobre todo en documentación técnica, en parte porque plataformas de documentación como Mintlify generan el archivo automáticamente en los sitios que alojan. Es una buena razón para tenerlo si publicas documentación, y una mala razón para dar por hecho que el ecosistema se ha estandarizado. Que una convención sea trivialmente barata de adoptar dice muy poco sobre si alguien la está consumiendo.
Cómo escribir llms.txt: el formato exacto
La especificación define un orden de documento preciso, y ese orden es justamente el punto: un consumidor debería poder analizarlo con un lector de Markdown sencillo, no con heurísticas.
El único elemento obligatorio es un H1 con el nombre del sitio o del proyecto. Todo lo demás es opcional, pero con la posición limitada: una cita en bloque opcional justo después del H1 con un resumen breve que aporte la información clave para entender el resto; después, cero o más secciones Markdown de prosa o listas con detalle adicional, sin encabezados; y por último, cero o más secciones H2, cada una con una lista de enlaces.
Las líneas de enlace tienen la forma de un elemento de lista Markdown con un hipervínculo y una descripción opcional tras dos puntos: el nombre, la URL y una frase que explique cuándo conviene leerla. Esas descripciones hacen trabajo de verdad: son lo que permite al modelo decidir en cuáles dos de tus quince enlaces gastar contexto, así que escríbelas como instrucciones de enrutado, no como copy de marketing.
Un H2 tiene significado especial: la sección titulada Optional. Los enlaces que coloques bajo ella pueden omitirse cuando hace falta un contexto más corto. Úsala para changelogs, material de referencia profundo y cualquier cosa que un lector pueda resolver sin ello. Otra convención distinta, llms-full.txt, que contiene el texto completo concatenado de tu documentación, es popular entre las plataformas de documentación pero no forma parte de la especificación básica: trátala como un extra y publícala solo si tu contenido cabe de verdad en una ventana de contexto moderna.
- Sírvelo en la raíz del dominio como /llms.txt, con text/plain o text/markdown, sobre HTTPS.
- Que sea corto. Entre diez y treinta enlaces curados es mejor que un volcado del sitemap; si necesitaras todas las URL, ya tienes un sitemap XML.
- Escribe descripciones que desambigüen: «planes de precios y límites», no «descubre más sobre Growli».
- Enlaza solo páginas públicas y estables. Los enlaces rotos en un índice curado son peores que no tener índice.
- Regenéralo en tu build, no a mano, si tu documentación cambia cada semana.
ORDEN DEL ARCHIVO
Los cuatro bloques posicionales de un llms.txt válido
H1 con el nombre del proyecto
El único elemento obligatorio: el nombre del sitio o del proyecto, como un único H1.
Resumen en cita en bloque
Opcional, justo después del H1: el contexto clave para entender todo lo que viene debajo.
Detalle sin encabezados
Prosa o listas opcionales que aportan contexto. En este bloque no se permiten encabezados.
Secciones H2 de enlaces
Cada una contiene elementos con la forma [nombre](url): descripción, indicando cuándo leer esa página.
Sección Optional
Un H2 titulado Optional marca los enlaces que un consumidor puede omitir cuando el contexto es corto.
Un ejemplo real: el archivo de Growli
El nuestro es deliberadamente pequeño. Growli mide cómo los asistentes de IA mencionan y recomiendan empresas, así que las páginas que un agente necesita son: qué hace el producto, cómo funciona la medición, precios y los artículos de investigación que definen nuestros términos. Nada más se gana un hueco.
Leído como archivo, es un H1, un resumen en una cita en bloque y dos secciones H2, siendo la segunda Optional. Cada línea de abajo es una línea de ese archivo:
- # Growli
- > Growli tracks how AI assistants — ChatGPT, Gemini, Claude, Perplexity, Copilot and Grok — mention, compare and recommend businesses, and turns the gaps into prioritized actions.
- ## Core
- How it works: the measurement method — prompt sets, run cadence, and how mentions and recommendations are scored.
- AI visibility: definition of the metric, what moves it, and what does not.
- ## Optional
- Blog: research posts on assistant behaviour, citation patterns and measurement methodology.
Dónde encaja junto a robots.txt y los datos estructurados
Estos tres archivos responden a tres preguntas distintas, y confundirlos es el error más habitual que vemos en las auditorías.
robots.txt responde a «¿puedes descargar esto?»: es un archivo de control de acceso para rastreadores, con un comportamiento de análisis documentado desde hace años, y es donde permites o bloqueas rastreadores de IA concretos. Si quieres restringir el entrenamiento o el rastreo, eso ocurre ahí y en tus condiciones, nunca en llms.txt. Los datos estructurados responden a «¿qué es esto?»: el vocabulario de Schema.org en JSON-LD te permite afirmar sin ambigüedad que eres una Organization con este nombre, estos productos, este precio y estas reseñas, que es justo el tipo de hecho legible por máquina que sobrevive a un resumen. llms.txt solo responde a «¿qué debería leer primero?», para un consumidor que ya ha decidido leerte.
En cuanto al retorno del esfuerzo, el orden es poco lucido pero consistente: primero arregla la rastreabilidad y el contenido renderizado en servidor, después los datos estructurados a nivel de entidad y, por último, llms.txt. Un archivo que enlaza a páginas que se muestran en blanco sin JavaScript no ayuda a nadie.
TRES ARCHIVOS, TRES FUNCIONES
Qué archivo responde a qué pregunta
robots.txt: ¿puedes descargar esto?
Control de acceso para rastreadores, incluido permitir o bloquear rastreadores de IA concretos. Documentado por Google Search Central.
Schema.org JSON-LD: ¿qué es esto?
Declara tu organización, productos, precios y reseñas como hechos legibles por máquina que sobreviven al resumen.
llms.txt: ¿qué debería leer primero?
Un índice Markdown curado para un consumidor que ya ha decidido leerte. Sin permisos y sin directivas.
Entonces, ¿deberías publicar uno?
Sí, si tienes documentación, una API, un producto para desarrolladores o una base de conocimiento: el coste son minutos, el archivo es legible para personas y el flujo en el que alguien pasa la URL de tu llms.txt a un agente ya es habitual. Publícalo, mantenlo al día y sigue adelante.
Probablemente no merezca la pena priorizarlo si eres un negocio de servicios local, un catálogo de e-commerce o una web de marketing con doce páginas. No hay pruebas de que cambie si un asistente te recomienda, y el esfuerzo rinde más en lo que los asistentes sí leen de forma demostrable: páginas que se renderizan sin JavaScript, contenido explícito de comparativas y precios, datos de entidad coherentes en tu sitio y en directorios de terceros, y presencia en las webs de reseñas y recopilatorios en los que se apoyan los modelos cuando responden a «el mejor X para Y».
La prueba honesta es medir. Registra con qué frecuencia te nombran los asistentes, en qué prompts y qué fuentes citan cuando lo hacen: para eso está nuestro seguimiento de visibilidad en IA, y cómo funciona explica el método. Si publicar llms.txt mueve esos números en tu sitio, lo verás. Y si no, habrás invertido veinte minutos y aprendido algo cierto.
Mira qué dice la IA de tu negocio
Growli mide tu cuota de respuestas IA en ChatGPT, Gemini, Claude y Perplexity — y convierte cada brecha en acciones priorizadas.
ComenzarFAQ
No. John Mueller, de Google, ha dicho públicamente que Google no usa llms.txt en Search y lo ha comparado con la antigua metaetiqueta keywords; además, el archivo no aparece por ningún lado en la documentación de rastreo e indexación de Google Search Central. El archivo que Google sí documenta para dar instrucciones a los rastreadores es robots.txt.
No existe documentación pública de ningún fabricante de asistentes relevante que afirme que sus rastreadores o sistemas de recuperación usan /llms.txt como señal de descubrimiento o de posicionamiento. Lo que sí ocurre de forma fiable es el uso manual y guiado por agentes: un usuario o un agente de programación recibe la URL y sigue los enlaces que contiene. Publícalo para ese caso, no por un beneficio automático que das por supuesto.
robots.txt es un archivo de control de acceso con un comportamiento de análisis documentado para rastreadores: indica a rastreadores concretos qué rutas pueden o no descargar. llms.txt no contiene directivas ni concede permisos: es una lista de lectura curada en Markdown que sugiere qué páginas son más útiles. Bloquear o permitir rastreadores de IA es cosa de robots.txt; llms.txt no puede hacerlo.
llms-full.txt es una convención, popularizada por las plataformas de documentación, que concatena el texto completo de tu documentación en un único archivo para que un agente pueda cargarlo todo de una vez. No forma parte de la especificación básica de llms.txt. Publícalo solo si tu documentación cabe de verdad en una ventana de contexto; si no, el índice curado más las versiones .md limpias de cada página resultan más útiles.
Sírvelo en la raíz de tu dominio (example.com/llms.txt) sobre HTTPS, con text/plain o text/markdown. La especificación de llmstxt.org pide Markdown, y la estructura importa: un H1 con el nombre del sitio, una cita en bloque opcional justo debajo a modo de resumen, prosa opcional sin encabezados y después secciones H2 con listas de enlaces.
No hay pruebas de que lo haga, y conviene desconfiar de quien lo venda como táctica de visibilidad en IA. Los asistentes responden al contenido que realmente pueden descargar y a cómo te describen en la web: páginas renderizadas en servidor, precios y comparativas claros, datos de entidad coherentes y cobertura de terceros. Publica llms.txt porque es barato y ayuda a los agentes que tú invitas, y después mide si algo ha cambiado.
