Los modelos de lenguaje grandes están cambiando la forma en que la gente encuentra información.
En lugar de solo visitar sitios web directamente, la gente está haciendo cada vez más preguntas a los asistentes de IA que requieren información de muchas fuentes.
Los sitios web tradicionales se diseñaron principalmente para visitantes humanos y motores de búsqueda. Contienen menús de navegación, scripts, diseño, anuncios y elementos interactivos. Esas características pueden ser útiles para una persona mientras dificultan que una herramienta automatizada identifique el material más importante.
Una nueva convención llamada llms.txt propone una idea más sencilla: crear un pequeño archivo Markdown que ayude a los sistemas de IA a entender qué contiene un sitio web y dónde se encuentra su información más útil.
La propuesta original de llms.txt lo describe como una forma de proporcionar información adaptada a los modelos de lenguaje para usarla durante la inferencia. Sigue siendo una propuesta y no un estándar web adoptado universalmente, por lo que la compatibilidad varía entre herramientas.
llms.txt en términos simples
Un archivo llms.txt es un documento Markdown normalmente ubicado en la raíz de un sitio web:
https://example.com/llms.txtPuede proporcionar:
- Una breve descripción del sitio web
- Enlaces a páginas importantes y documentación
- Resúmenes que explican qué secciones importantes contienen
- Un grupo opcional de enlaces secundarios que se pueden omitir cuando el contexto es limitado.
El formato publicado solo requiere un título H1. También puede incluir un resumen de citas, prosa explicativa, secciones H2 y listas de enlaces Markdown con breves notas.
Es útil comparar la intención de tres archivos de nivel raíz sin tratarlos como equivalentes:
robots.txt: instrucciones sobre preferencias de acceso del rastreadorsitemap.xml: un mapa de las URL y archivos del sitio webllms.txt: una guía seleccionada de contenido importante para sistemas de IA
Ejemplo de archivo llms.txt
# Example Documentation
> Example is a platform for managing research documents.
## Documentation
- [Getting Started](https://example.com/start)
Learn how to begin.
- [API Reference](https://example.com/api)
Complete API documentation.
## Guides
- [Importing Data](https://example.com/import)
Learn supported formats.Markdown es legible sin un visualizador especial. Una persona puede editar y revisar el archivo en un editor de texto, un equipo puede mantenerlo en control de versiones y el software puede interpretar sus encabezados y enlaces sin tener que eliminar primero la interfaz de una página web.
Por qué existe llms.txt
Una página web normal puede incluir navegación, menús, scripts, enlaces relacionados, anuncios, diseño y controles interactivos. La explicación o documentación oficial puede ser solo una parte de esa página.
La propuesta llms.txt ofrece un punto de entrada seleccionado. No reemplaza las páginas vinculadas; le dice al lector de qué trata la colección y dónde buscar el siguiente paso.
Piensa en un catálogo de una biblioteca. El catálogo no es toda la biblioteca. Te ayuda a encontrar los libros adecuados.
Beneficios de llms.txt
Mejor descubrimiento de contenido
Un agente compatible puede identificar rápidamente el tema del sitio, las páginas importantes y dónde está la información autorizada.
Contexto de IA más limpio
Los enlaces, las descripciones y los encabezados seleccionados ofrecen un inicio más claro que deducir relevancia desde la navegación y la interfaz.
Documentación legible por personas
Como llms.txt es Markdown, se puede leer, editar, revisar y mantener bajo control de versiones con herramientas comunes.
Intercambio preparado para el futuro
Una convención abierta y ligera puede aportar contexto estructurado sin vincular un sitio a un solo proveedor de IA.
Estos beneficios dependen de que una herramienta elija leer y usar el archivo. Publicar llms.txt no causa por sí solo que un servicio de IA descubra, recupere o priorice un sitio web.
Lo que llms.txt no hace
llms.txt no permite:
- Obligar a los sistemas de IA a leer un sitio web
- Garantizar la inclusión en respuestas generadas por IA
- Garantizar mejoras en la búsqueda o en la clasificación de IA
- Reemplazar el SEO normal o una estructura web accesible
- Sustituir
robots.txt, un mapa del sitio o buenos enlaces internos - Impedir la extracción automatizada ni conceder permiso de acceso
- Crear automáticamente una base de conocimiento para IA
Es una pista útil y una referencia estructurada, no un sistema de permisos. Los propietarios de sitios web aún necesitan controles de acceso adecuados, licencias, políticas de rastreadores y decisiones de privacidad.
llms.txt frente a robots.txt
| Archivo | Propósito |
|---|---|
robots.txt | Comunica las preferencias de acceso del rastreador |
sitemap.xml | Lista de URL y archivos del sitio web |
llms.txt | Proporciona un contexto cuidadosamente seleccionado que es legible por IA |
Estos archivos resuelven problemas diferentes. Google describe robots.txt como una forma de indicar a los rastreadores de motores de búsqueda a qué URL pueden acceder, principalmente para gestionar su tráfico. Describe un mapa del sitio como un archivo que identifica las páginas y los archivos que un sitio considera importantes.
La propuesta llms.txt ni es un mecanismo de control de acceso ni un inventario completo de URL. Es una capa editorial: el propietario del sitio elige un subconjunto útil de material y lo explica de forma concisa en Markdown.
Crear llms.txt manualmente
Un flujo de trabajo básico es sencillo:
- Identifica las páginas que mejor explican el sitio web.
- Cree un archivo Markdown con un título H1 claro y un breve resumen.
- Agrupa enlaces importantes bajo encabezados descriptivos H2.
- Añade notas de una oración donde el propósito de un enlace no sea obvio.
- Coloca el archivo en la raíz del sitio web.
https://website.com/llms.txtMantén la lista selectiva. Una guía breve del contenido de referencia suele ser más útil que un segundo mapa del sitio con todas las URL. Revisa el archivo cuando la documentación cambie de ubicación, cambien las políticas o se añadan páginas importantes.
SourceShelf publica su propio archivo llms.txt
SourceShelf publica su propio archivo llms.txt. Esto permite que los sistemas de IA y los desarrolladores descubran la documentación y los conceptos clave de la aplicación mediante la misma convención descrita en este artículo.
Cómo SourceShelf utiliza llms.txt
SourceShelf trata llms.txt como un puente útil entre sitios web y flujos de trabajo de conocimiento local de IA.
Muchos sitios web ya contienen documentación valiosa, investigaciones, políticas, información sobre productos y guías técnicas. Una colección local de llms.txt puede identificar ese material de manera ordenada y legible por humanos. SourceShelf puede importar la colección local a su Biblioteca y crear un paquete guardado que permanecerá en su Mac.
Este flujo de trabajo funciona deliberadamente sin conexión. SourceShelf no rastrea un sitio web ni recupera URL remotas arbitrarias de un índice importado.
Importar llms.txt con SourceShelf
Una importación típica funciona así:
- Elija un archivo
llms.txto una carpeta que contenga uno. - SourceShelf lee el índice local.
- Las referencias seguras de
.md,.markdowny.txtque se encuentran debajo de la carpeta seleccionada se resuelven e importan localmente. - El índice se convierte en el primer elemento de la Biblioteca y los documentos locales siguen en el orden del índice.
- SourceShelf crea un paquete guardado con el nombre del título del índice.
Los enlaces HTTP o HTTPS remotos no se descargan. SourceShelf mantiene sus títulos, descripciones y procedencia como referencias no disponibles para que puedas ver el índice con el nombre sin transferir silenciosamente el contenido del sitio web.
Exportar colecciones llms.txt con SourceShelf
SourceShelf también puede crear una Carpeta de Colección llms.txt a partir de un paquete guardado:
my-research-pack/
├── llms.txt
├── documents/
├── assets/
├── sourceshelf-manifest.json
└── checksums.sha256La carpeta contiene documentos ordenados, activos archivados con referencias, un manifiesto SourceShelf con procedencia y comprobaciones de suma de verificación deterministas para verificar la integridad. Referencias web no disponibles con procedencia válida pueden aparecer en la sección opcional del índice, pero SourceShelf no las descarga.
Este es un formato de colección portátil, no una promesa de que todos los productos de IA lo importarán directamente. Puedes mantener la carpeta como conocimiento local legible, adaptarla para otro flujo de trabajo o exportar el mismo paquete guardado en un formato diferente.
De llms.txt a un flujo de trabajo de SourceShelf
Una vez que una colección es un paquete guardado, puedes exportar un AI Reference Pack o usar Local AI Access para compartir una instantánea inmutable y de solo lectura con un cliente compatible. Solo se expone el paquete seleccionado; SourceShelf no comparte el resto de la Biblioteca.
Si estás comenzando con una mezcla más amplia de documentos y páginas web en lugar de un índice existente, el proceso de trabajo de la base de conocimientos de IA privada explica cómo capturar, organizar y compartir selectivamente fuentes locales.
Relación con OKF
llms.txt y Open Knowledge Format resuelven problemas diferentes.
- llms.txt: ayuda a una herramienta a descubrir y navegar por el conocimiento curado de un sitio web.
- OKF: estructura el conocimiento en una colección portátil de conceptos y metadatos de Markdown.
- SourceShelf: puede organizar fuentes locales entre esas dos etapas y exportarlas para un flujo de trabajo seleccionado.
La guía de Open Knowledge Format explica con más detalle el empaquetado. Ningún formato amplía la ventana de contexto de un modelo ni garantiza que una herramienta utilice todas las fuentes.
Crear conocimiento que la IA realmente pueda usar
Los sistemas de IA necesitan contexto. Ese contexto es más útil cuando está estructurado, portátil, comprensible y mantenido por las personas que lo crearon.
llms.txt es un pequeño paso hacia la facilitación del descubrimiento de conocimientos en línea para los sistemas y agentes de IA. Su valor proviene de una cuidadosa curaduría, resúmenes precisos, enlaces estables y herramientas que deciden apoyar la convención.
SourceShelf amplía esa idea ayudándote a capturar, organizar y empaquetar el conocimiento localmente, para que tu información siga siendo útil en las herramientas de IA que elijas.