Funciones / IA y preparación para agentes
Cada sitio que cuidas se revisa buscando las convenciones que espera un agente de IA: si se puede descubrir, si se puede leer su contenido, qué dice sobre los rastreadores y qué puede hacer realmente. Nada de esto se evalúa como fallo: no publicar nada de ello es un sitio web corriente, y para bastantes clientes rechazar a los rastreadores es el encargo.
¿Cuáles de tus clientes están listos para que los lea algo que no es una persona?
Es una pregunta que ahora mismo nadie puede responder sobre su propia cartera y
que los clientes empiezan a hacer. Si cuidas treinta sitios, responderla hoy
significa abrir treinta archivos robots.txt a mano, y después una segunda
pasada por la media docena de rutas /.well-known/ que han aparecido en los
últimos dos años. Nadie lo hace, así que nadie lo sabe.
Esta comprobación lo responde para toda la cartera de una vez, y vuelve a responderlo cada día.
Se registran como hechos, nunca como fallos. No publicar nada de esto es un sitio web corriente, no uno roto, y para bastantes clientes rechazar a los rastreadores es precisamente el encargo.
Informarlo en rojo sería inventar un problema para poder vender la solución. Un editor, un fotógrafo, un sitio de socios: mucha gente ha decidido, con toda la razón, que no quiere que su contenido se use como datos de entrenamiento. Una herramienta que puntuara esa decisión como un fracaso sería una herramienta discutiendo con quien la usa.
Cada sitio que añades se revisa buscando las convenciones que espera un agente de IA, en cuatro áreas: si se puede descubrir, si se puede leer su contenido, qué dice sobre los rastreadores y qué puede hacer realmente.
llms.txt y Markdown. Si hay un resumen en texto plano en la raíz y si las propias páginas responden en Markdown cuando algo lo pide, en lugar de servir una página de marcado de framework.
Un modelo que lee un sitio con una petición con forma de navegador paga por las clases CSS, el SVG en línea y el JavaScript para recuperar unos cientos de palabras de texto. Responder a la petición que realmente hizo es toda la diferencia.
Dieciocho rastreadores de IA por su nombre. GPTBot, ClaudeBot, PerplexityBot, Google-Extended y los demás. Que se nombre a uno ya es la señal: significa que alguien decidió, en vez de heredar lo que viniera por defecto. Si permitieron o bloquearon se informa, nunca se juzga.
Content Signals. La convención más reciente para decir qué puede hacer un rastreador con lo que se lleva: buscar, entrenar o responder directamente. Publicada o no, conviene saber cuál de las dos.
/.well-known/api-catalog, que es como un
sitio le dice a un agente qué ofrece en lugar de dejar que lo adivine a partir
del HTML./.well-known/mcp o
un índice de habilidades: las dos maneras de que un sitio entregue a un agente
sus propios procedimientos en vez de confiar en que los deduzca.Casi nada publica esto todavía. Justo por eso merece la pena tener la comprobación ahora: la respuesta de hoy para toda la cartera es una línea base, y el primer cliente que pregunte preguntará contra ella.
No, y quien te diga que un archivo .well-known lo hará te está vendiendo algo.
Publicar estas convenciones hace que un sitio sea más barato y más fiable de leer
para un agente que ya quiere leerlo. Lo que hace que se cite un sitio es lo mismo
de siempre: ser la respuesta más clara disponible.
Es una convención con adopción real, no un estándar ratificado, y lo mismo vale para casi todo lo que se revisa aquí. Se dice claramente en lugar de disimularlo: esta es un área joven, y una herramienta de monitorización que presente una propuesta como un requisito está haciendo lo mismo que le critica a los escáneres de cabeceras.
Es una decisión sobre el negocio de tu cliente, no una decisión técnica, y esto no la tomará por ti. Lo que sí hará es decirte qué dice hoy cada sitio, para que la decisión sea al menos deliberada.
El rastreador de este servicio se identifica en su user agent y pide solo la
página de inicio del sitio, su robots.txt y el puñado de rutas .well-known
listadas arriba. No recorre el sitio entero.
En todos, incluido el gratuito. Todas las comprobaciones se ejecutan en todos los planes para todos los sitios.