AI Search · Guía
Cómo preparar una web para buscadores y sistemas de IA
No consiste en añadir un truco a una web normal. Consiste en que una máquina pueda rastrearla, leer su contenido sin ejecutar nada, entender qué empresa hay detrás y encontrar en ella respuestas que merezca la pena citar.
Esta guía explica cada pieza, qué se puede medir y qué no se puede garantizar. Cada sección cierra con lo que hicimos en nuestra propia web, separando lo que es un hecho, lo que decidimos y lo que interpretamos. No es un caso de éxito: es un registro de decisiones.
Por el equipo de VELIA · revisada el
La respuesta corta
Una web está preparada para buscadores y sistemas de IA cuando cumple seis condiciones. Ninguna es exclusiva de la IA: son las mismas que hacen que una web se entienda bien.
Se puede rastrear. El robots.txt, los códigos de respuesta, las URL canónicas y el sitemap dicen lo mismo, y nada importante queda detrás de un inicio de sesión.
El contenido está en el documento. El HTML que entrega el servidor ya contiene el texto, los encabezados y los enlaces, sin depender de que se ejecute JavaScript ni de que alguien pulse algo.
La empresa es una sola. El título, la descripción, los encabezados, los datos estructurados y cualquier otra declaración describen la misma empresa, y ninguna página antigua cuenta otra.
Los datos estructurados describen lo que la página dice. Ni más, ni otra cosa.
Hay páginas que responden preguntas. De forma autosuficiente, con criterio propio y con evidencia que se pueda comprobar.
La autoridad también viene de fuera. Perfiles, menciones y referencias que otros pueden verificar.
Y dos cosas que conviene saber antes de empezar: estar preparado no garantiza aparecer ni ser citado en ningún sistema, y un fichero llms.txt no sustituye a ninguna de las seis.
Cinco términos que se suelen confundir
Se usan como si fueran sinónimos o como si fueran disciplinas separadas. No son ninguna de las dos cosas: son capas del mismo problema, y cada una depende de la anterior.
- SEO
- Hacer que una web sea rastreable, indexable y relevante para las consultas de un buscador. Sigue siendo la base de todo lo demás: Google documenta que, para aparecer en sus funciones de IA, una página tiene que estar indexada y poder mostrarse en la búsqueda con un fragmento.
- AI Search
- Búsquedas cuya respuesta redacta un sistema a partir de varias fuentes, en lugar de devolver sólo una lista de enlaces: las respuestas generativas de Google o de Bing y Copilot, la búsqueda de ChatGPT, Perplexity. Cambia la forma de la respuesta; no cambia que el sistema necesite encontrar y entender las fuentes.
- Descubribilidad por LLM
- Que un modelo de lenguaje pueda llegar a tu contenido cuando busca información en el momento de responder, y no sólo contar con lo que aprendió al entrenarse. Depende de que sus rastreadores de búsqueda puedan acceder, y es distinto de que tu contenido se use para entrenar: los proveedores documentan esas dos cosas por separado.
- Claridad de entidad
- Que exista una única descripción coherente de quién eres —qué empresa, qué hace, dónde y quién está detrás— en todas las superficies que una máquina lee. Es la condición previa: sin ella, lo demás describe a alguien que no se sabe quién es.
- Citabilidad
- Que una página pueda usarse como fuente de una respuesta: que responda a una pregunta concreta, que se entienda sin el resto de la web y que su afirmación central se pueda extraer y comprobar. Es lo más parecido a un objetivo que tiene todo esto, y lo que más depende del contenido.
Una máquina tiene que entender qué es tu empresa
Antes de poder usar tu web como fuente, un sistema tiene que poder decir qué empresa eres. Eso sólo ocurre si todas las superficies que lee dicen lo mismo.
Una máquina no lee tu web como una persona, de arriba abajo y en el orden que diseñaste. Lee declaraciones sueltas: el título de cada página, su descripción, sus encabezados, sus datos estructurados, los textos de los enlaces que apuntan a ella. Si esas declaraciones coinciden, forman una entidad. Si se contradicen, forman ruido.
El problema más común no es que falte información: es que sobra información antigua. Una empresa cambia de posicionamiento, reescribe la portada y deja vivas las páginas de la etapa anterior, que siguen indexadas y siguen describiendo a otra empresa.
Qué revisar:
- que el título y la descripción de cada página describan a la misma empresa;
- que los encabezados principales sean coherentes con esa descripción;
- que las páginas de etapas anteriores no sigan siendo indexables si describen algo que ya no eres;
- que los datos estructurados de la organización coincidan con el texto visible.
En veliacorp.com
- Hecho
- En septiembre de 2026 auditamos veliacorp.com y encontramos dos empresas en el mismo dominio. Las páginas reescritas describían una compañía de transformación y operación digital; cuatro páginas de una etapa anterior —precios, una demostración, un programa comercial y una página de producto— seguían siendo indexables y describían un producto de software con precio.
- Decisión
- No las borramos: hay enlaces y correos ya enviados que dependen de ellas. Las marcamos con
noindex, follow. Siguen respondiendo a quien tenga el enlace y dejan de competir por representar a la empresa en un buscador. - Interpretación
- No hay ninguna señal fiable con la que un sistema externo pueda decidir cuál de dos descripciones de la misma empresa es la vigente. Si las dos están indexadas, las dos cuentan.
El contenido tiene que estar en el documento
Lo que una máquina puede leer con seguridad es lo que el servidor entrega en el HTML. Lo que sólo aparece después de ejecutar código o de una interacción puede no llegar a leerse nunca.
Muchas webs modernas entregan un documento casi vacío y construyen el contenido en el navegador. Para una persona el resultado es el mismo. Para un rastreador depende de si ejecuta ese código, cuándo y hasta dónde, y eso no lo decides tú.
La comprobación es sencilla: pide la página sin ejecutar JavaScript y mira qué queda. Tienen que estar el texto completo, la jerarquía de encabezados —un solo h1 y secciones con h2— y los enlaces. Las listas tienen que ser listas y las fechas, fechas (<time>), no párrafos que lo parecen.
Cuidado también con lo que se esconde por diseño: pestañas, acordeones y animaciones de entrada. Si el contenido está en el documento aunque esté plegado, se puede leer. Si sólo se crea al pulsar, no existe hasta que alguien pulsa.
En veliacorp.com
- Hecho
- Durante semanas, un efecto de aparición al hacer scroll dejaba invisible media portada de veliacorp.com cuando el JavaScript no se ejecutaba. El comentario del código decía que sin JavaScript todo se veía igual; la regla que se aplicaba hacía lo contrario. Nadie lo vio hasta revisar una captura de la página completa.
- Decisión
- El estado de reposo pasó a ser el visible: un bloque sólo se oculta para animarse cuando consta que hay JavaScript para volver a mostrarlo. Una comprobación automática carga la portada sin JavaScript y falla si algún bloque queda invisible.
- Interpretación
- No podemos saber qué rastreador ejecuta JavaScript y cuál no. La única versión de la página que funciona para todos es la que no lo necesita.
¿Y llms.txt?
llms.txt es una propuesta, publicada en 2024, para colocar en la raíz de un sitio un fichero en Markdown que resuma su contenido y enlace sus páginas principales, pensado para que un modelo lo consulte cuando busca información. Es una propuesta, no un estándar adoptado.
Ninguna de las documentaciones de rastreadores que citamos en esta guía —Google, OpenAI y Perplexity— dice que sus sistemas lean ese fichero en otros sitios. OpenAI y Perplexity publican uno para su propia documentación, lo que no es lo mismo. Google, además, dice expresamente que no hace falta crear archivos de texto para IA ni datos estructurados especiales para aparecer en sus funciones de IA.
Nosotros mantenemos uno, y por un motivo concreto: es el sitio donde está escrita, en un solo texto y sin diseño, la descripción exacta de la empresa, y nos sirvió de referencia para comprobar que el resto de superficies dijeran lo mismo. Lo que no hace es sustituir al documento: si el contenido no está en el HTML, un resumen aparte no lo arregla.
Qué es exactamente, qué está documentado y qué no, y en qué se diferencia de robots.txt: ¿Qué es llms.txt y sirve realmente para algo?
Search y AI Search necesitan una web rastreable
Si un rastreador no puede acceder a una página, esa página no existe para el sistema que depende de él. Y hoy conviene saber que un mismo proveedor puede usar rastreadores distintos para cosas distintas.
Lo básico no ha cambiado: un robots.txt que no bloquee lo que quieres que se encuentre, páginas que respondan con el código correcto, una URL canónica por página y un sitemap que liste sólo las páginas que representan a la empresa hoy.
Lo que sí ha cambiado es que los proveedores separan el rastreo para buscar del rastreo para entrenar modelos, y lo documentan con nombres distintos que se controlan por separado en robots.txt:
- OpenAI documenta
OAI-SearchBotpara mostrar webs en los resultados de búsqueda de ChatGPT,GPTBotpara rastrear contenido que puede usarse en el entrenamiento de sus modelos, yChatGPT-Userpara acciones que inicia un usuario. - Perplexity documenta
PerplexityBotpara mostrar y enlazar webs en sus resultados, yPerplexity-Userpara las consultas de los usuarios, del que advierte que por lo general no sigue las reglas de robots.txt. - Google documenta
Google-Extended, que controla si el contenido se usa para entrenar Gemini y para fundamentar sus respuestas, y especifica que no afecta a la inclusión ni a la posición en Google Search.
La consecuencia práctica es que bloquear «la IA» en bloque tiene efectos que no siempre se buscan: puede cerrar la puerta a los sistemas que citarían tu web como fuente. Permitir que te encuentren y decidir sobre el entrenamiento son dos decisiones distintas.
En veliacorp.com
- Hecho
- El robots.txt de veliacorp.com permite el acceso a todos los rastreadores y declara el sitemap; no tiene reglas por proveedor. Cualquier dominio que no sea el de producción —una versión de prueba, por ejemplo— responde con la cabecera
X-Robots-Tag: noindex, nofollow. - Decisión
- El noindex fuera de producción se decide por el nombre del dominio y no por una variable de configuración: una variable se puede olvidar, y el olvido no da error en ninguna de las dos direcciones. Sobre el entrenamiento, a la fecha de esta guía, no hemos escrito ninguna regla: es una decisión de negocio, y la tenemos separada de la de ser encontrados.
- Interpretación
- Una versión de prueba indexable compite con la de producción con el mismo contenido. No hay ninguna ventaja en que eso ocurra por descuido.
Los datos estructurados tienen que decir lo mismo que la web
Los datos estructurados no añaden información que la página no tenga: sirven para declararla de forma inequívoca. Si contradicen a la página, lo que añaden es una contradicción.
Es el punto donde más fácil es equivocarse con buena intención. Casi todas las guías recomiendan añadir más tipos de marcado de schema.org, y cada tipo que se añade es una afirmación más que tiene que ser verdad.
Lo que conviene declarar suele ser poco: quién es la organización (Organization), qué sitio es el suyo (WebSite) y, en las páginas de contenido, qué es cada una y quién la firma (Article, con autor y fechas reales). Todo relacionado mediante identificadores (@id), para que no haya dos copias de la misma empresa que puedan divergir.
Y conviene no declarar lo que no se puede sostener: valoraciones sin fuente, preguntas frecuentes de un producto que ya no se vende, perfiles externos que no existen. Google recuerda que no hay ningún marcado especial necesario para aparecer en sus funciones de IA.
En veliacorp.com
- Hecho
- Una página de la etapa anterior de veliacorp.com publicaba un marcado
FAQPagecon el precio, la permanencia y los usuarios incluidos de un producto que ya no existe, en el mismo documento que el marcadoOrganizationque describía a la compañía actual. - Decisión
- Retiramos el bloque de marcado, no el texto de la página, y no lo sustituimos por otro. El sitio declara ahora una organización y un sitio web relacionados entre sí, con sus fundadores. No declaramos perfiles externos (
sameAs) porque, a la fecha de esta guía, no hemos publicado ninguno que enlazar: uno inventado sería peor que ninguno. - Interpretación
- El marcado se lee como una declaración explícita, no como un texto que haya que interpretar. Una contradicción ahí no se diluye entre el resto: queda declarada.
Las páginas tienen que responder preguntas
Un sistema que redacta una respuesta busca fuentes que respondan a lo que se le ha preguntado. Una web que sólo explica quién es la empresa responde a una única pregunta, y es la que sólo hace quien ya la conoce.
Una página que puede servir de fuente tiende a cumplir cinco condiciones:
- Responde a una pregunta concreta, y lo dice al principio, no al final.
- Se entiende sola, sin necesitar el resto de la web ni un contexto que sólo tiene quien la escribió.
- Distingue los hechos de las opiniones, y dice cuál es cuál.
- Aporta algo comprobable: un dato, una decisión, una fuente, un ejemplo real.
- Se puede extraer: encabezados que nombran lo que viene debajo y párrafos que no mezclan tres ideas.
Esta guía está escrita así a propósito: cada sección empieza con su respuesta en una o dos frases, y lo que hicimos nosotros está separado de la explicación general.
Lo contrario es más común: páginas que existen para ocupar una búsqueda, con mucho texto y ninguna afirmación que se pueda comprobar. Se pueden encontrar; es más difícil que alguien —persona o sistema— las use para afirmar algo.
En veliacorp.com
- Hecho
- Cuando auditamos veliacorp.com, ninguna de sus páginas respondía a una pregunta que alguien haría a un buscador: todas explicaban quién es VELIA. La página de seguridad publicaba, y publica, esta frase: «Hoy no tenemos certificación ISO 27001».
- Decisión
- Mantener un registro de afirmaciones: lo que no tiene fuente, fecha y responsable no se publica aunque sea cierto, y una comprobación automática lo vigila en el título, la descripción y el texto visible de cada página —es una de las reglas con las que decidimos—. Y empezar el contenido por esta guía.
- Interpretación
- Una afirmación concreta, que se puede comprobar y que se entiende sin contexto es más útil como fuente que un párrafo de promesas. La que más se parecía a eso en todo el sitio era la que reconocía una carencia.
La autoridad no nace dentro de una sola web
Una web puede declarar quién es; no puede declarar que es una fuente fiable. Eso depende también de lo que dicen de ella otros sitios.
Los perfiles oficiales de la empresa enlazados entre sí, los datos societarios públicos, los clientes que se pueden comprobar, las menciones en publicaciones y los enlaces de sitios que tratan el mismo tema son señales que están fuera de tu web. Ninguna se puede fabricar dentro de ella.
Es la parte más lenta y la que menos depende de la técnica. También es la más fácil de falsear: enlaces comprados, directorios sin lectores, contenido publicado en volumen para aparentar actividad. Además del riesgo, tiene un problema de coherencia: una web que presume de rigor y compra señales de autoridad se contradice de una forma que cualquiera puede comprobar.
En veliacorp.com
- Hecho
- A la fecha de esta guía, VELIA tiene un cliente que se puede citar y comprobar —Cónsul Jurídico, cuya infraestructura construimos y seguimos operando— y ningún perfil externo declarado en su web.
- Decisión
- No añadir perfiles que no existen, no comprar enlaces y empezar por lo que depende de nosotros: publicar conocimiento que se pueda comprobar.
- Interpretación
- La autoridad externa es la capa que más tarda en moverse. Por eso tiene sentido empezar por las demás: no hay nada que referenciar si antes no hay nada que merezca serlo.
Qué se puede medir
Se puede medir si una página está indexada, si aparece, si trae visitas y si esas visitas hacen algo. Si un sistema de IA la usa como fuente se puede observar, pero no medir con la misma fiabilidad.
Son seis capas, y conviene no mezclarlas:
- Indexación
- Si la página está en el índice de un buscador. Google Search Console y Bing Webmaster Tools lo informan para sus buscadores.
- Aparición
- Para qué consultas se muestra y cuántas veces. Las mismas herramientas. Google indica que la actividad de sus funciones de IA —AI Overviews y AI Mode— se incluye en el informe de rendimiento de Search Console, dentro de los totales de búsqueda web.
- Citación
- Si una respuesta generativa usa la página como fuente. A la fecha de esta guía no conocemos un informe general de los proveedores que lo mida; se puede observar repitiendo un conjunto fijo de preguntas y anotando las fuentes que aparecen.
- Referencia
- Si el sistema menciona a la empresa aunque no la enlace. Sólo se puede observar a mano, y con cautela: la misma pregunta no produce siempre la misma respuesta.
- Visitas
- Cuántas llegan desde buscadores y desde sistemas de IA, identificables por el sitio de procedencia en la analítica.
- Conversión
- Qué hacen esas visitas. Es la única capa que depende por completo de tu propia medición.
La regla más útil es no mezclarlas. Estar indexado no es aparecer, aparecer no es ser citado y ser citado no es que alguien llegue. Una cifra que combine las seis en una sola puntuación está estimando, no midiendo.
En veliacorp.com
- Hecho
- veliacorp.com mide en un sistema propio las acciones que importan, como el envío del formulario de contacto. Al auditarlo encontramos que el evento del único botón de contacto de la portada estaba declarado y no lo enviaba nadie.
- Decisión
- Conectarlo, y dejar escrito junto a cada evento declarado quién lo emite o, si no lo emite nadie a propósito, por qué.
- Interpretación
- Un cero en una medición puede significar que no ocurre nada o que no se está midiendo. Hasta saber cuál de las dos es, el cero no dice nada.
Qué no se puede garantizar
Ninguna preparación garantiza aparecer en los resultados de un buscador, en la respuesta de un sistema de IA ni ser recomendado por él. Quien lo garantiza está prometiendo algo que no controla.
Los proveedores documentan cómo acceden a las webs y qué requisitos técnicos piden. No documentan con qué criterios eligen las fuentes de una respuesta generativa, y esos criterios cambian. Tampoco controlas qué preguntan las personas ni cómo reformula el sistema sus preguntas.
Lo que sí está bajo tu control es lo que describe esta guía:
- que la web se pueda rastrear;
- que su contenido esté en el documento;
- que describa a una sola empresa;
- que su marcado diga la verdad;
- que tenga páginas que respondan preguntas con evidencia;
- y medir, sin mezclar capas, lo que pasa después.
Mejorar esas condiciones aumenta la probabilidad de que una web sea descubierta, entendida, puesta en contexto y tenida en cuenta. No la convierte en una certeza.
En resumen
Una web preparada para buscadores y sistemas de IA no es una web normal con un añadido. Es una web técnicamente accesible, semánticamente clara, útil para quien pregunta, verificable en lo que afirma y conectada con una autoridad que no depende sólo de ella.
Suele ser también una web mejor para las personas. Las dos audiencias piden lo mismo: saber quién eres, encontrar la respuesta y poder comprobarla.
En VELIA esto es lo que llamamos AI Search & Digital Visibility: preparar la infraestructura digital de un negocio para que pueda ser encontrada y entendida, sin prometer lo que nadie controla.
Nos cuentas cómo trabajáis hoy. Te decimos qué haríamos.
Fuentes
Documentación oficial consultada el . Los proveedores la actualizan; conviene comprobarla antes de tomar una decisión que dependa de ella.