Evolución del posicionamiento web en la era de la inteligencia artificial
Durante treinta años, una página web se concibió para dos tipos de lectores: las personas y los buscadores. La persona leía el texto, mientras que el buscador leía el código determinando la posición de la página en los resultados de búsqueda. Sin embargo, ha emergido un tercer lector: los modelos de lenguaje como ChatGPT, Claude o Perplexity, que no recorren enlaces tradicionales sino que entran en páginas específicas, las resumen y responden.
Este cambio plantea la cuestión de cómo optimizar contenido para los modelos de lenguaje. Una solución emergente es el archivo llms.txt, introducido por Jeremy Howard, cofundador de fast.ai, en septiembre de 2024. A diferencia del robots.txt clásico que indica dónde no debe entrar un rastreador, el llms.txt proporciona a los modelos un mapa curado con contenido destacado.
El formato de llms.txt es simple pero eficiente: un título, resumen y secciones con enlaces y descripciones. Existe una variante llamada llms-full.txt que despliega el contenido completo en un documento. La idea surge de la necesidad técnica de que los modelos no pueden analizar sitios complejos enteros debido a su límite de contexto.
En agosto de 2025, Vercel propuso un método innovador para insertar instrucciones directamente en HTML usando una etiqueta de script especial. Estos scripts, invisibles para los navegadores, son leídos por los modelos de lenguaje, facilitando interacciones personalizadas. No obstante, esta técnica suscita preocupaciones de seguridad, al ser similar a la inyección indirecta de comandos que aborda la industria tecnológica actual.
La autoinformación es otro desafío. El llms.txt es creado por el propio sitio, abriendo la puerta a que competidores declaren ser la fuente más confiable. Esto genera la necesidad de que los modelos encuentren métodos adicionales para discernir entre múltiples fuentes. Según Google, el llms.txt no influye en su motor de búsqueda, similar a cómo la etiqueta meta keywords perdió su efectividad por abuso.
A pesar de las incertidumbres, el llms.txt ofrece ventajas, especialmente en documentación técnica para agentes. Por ejemplo, Anthropic utiliza llms.txt en su API. Sin embargo, para medios de noticias, el impacto es menos claro.
Más allá de llms.txt, estrategias probadas como el HTML semántico y los datos estructurados en formato JSON-LD son esenciales. Estos métodos aseguran que los modelos comprendan la estructura y significado del contenido. Asimismo, los rastreadores de IA como los de OpenAI ahora distinguen entre tareas para entrenamiento o búsqueda.
Para simplificar estos procesos, plataformas como WordPress ofrecen soluciones integradas. Plugins como Yoast SEO y Rank Math soportan llms.txt y generan JSON-LD, facilitando la optimización sin necesidad de programación avanzada.
El orden de implementación recomienda primero verificar que el robots.txt no bloquee rastreadores útiles, asegurar que el JSON-LD sea preciso y curar el llms.txt para destacar el contenido más relevante. Estas prácticas han sido probadas a lo largo del tiempo, mientras que las estrategias experimentales más recientes requieren un manejo cauteloso.
El desafío de la web en 2026 es preparar su contenido no sólo para las IA, sino también para las personas. Las promesas recientes como el llms.txt deben evaluarse con escepticismo y evidencia, recordando que el lector humano sigue siendo el principal destinatario de cualquier contenido web.
