Owl Keeper

Funciones / IA y preparación para agentes

Monitorización de preparación para agentes de IA

Cada sitio que cuidas se revisa buscando las convenciones que espera un agente de IA: si se puede descubrir, si se puede leer su contenido, qué dice sobre los rastreadores y qué puede hacer realmente. Nada de esto se evalúa como fallo: no publicar nada de ello es un sitio web corriente, y para bastantes clientes rechazar a los rastreadores es el encargo.

La pregunta que ahora mismo nadie puede responder

¿Cuáles de tus clientes están listos para que los lea algo que no es una persona?

Es una pregunta que ahora mismo nadie puede responder sobre su propia cartera y que los clientes empiezan a hacer. Si cuidas treinta sitios, responderla hoy significa abrir treinta archivos robots.txt a mano, y después una segunda pasada por la media docena de rutas /.well-known/ que han aparecido en los últimos dos años. Nadie lo hace, así que nadie lo sabe.

Esta comprobación lo responde para toda la cartera de una vez, y vuelve a responderlo cada día.

Se registran como hechos, no como fallos

Se registran como hechos, nunca como fallos. No publicar nada de esto es un sitio web corriente, no uno roto, y para bastantes clientes rechazar a los rastreadores es precisamente el encargo.

Informarlo en rojo sería inventar un problema para poder vender la solución. Un editor, un fotógrafo, un sitio de socios: mucha gente ha decidido, con toda la razón, que no quiere que su contenido se use como datos de entrenamiento. Una herramienta que puntuara esa decisión como un fracaso sería una herramienta discutiendo con quien la usa.

Las cuatro cosas que se revisan

Cada sitio que añades se revisa buscando las convenciones que espera un agente de IA, en cuatro áreas: si se puede descubrir, si se puede leer su contenido, qué dice sobre los rastreadores y qué puede hacer realmente.

Si se puede descubrir y leer

llms.txt y Markdown. Si hay un resumen en texto plano en la raíz y si las propias páginas responden en Markdown cuando algo lo pide, en lugar de servir una página de marcado de framework.

Un modelo que lee un sitio con una petición con forma de navegador paga por las clases CSS, el SVG en línea y el JavaScript para recuperar unos cientos de palabras de texto. Responder a la petición que realmente hizo es toda la diferencia.

Qué dice sobre los rastreadores

Dieciocho rastreadores de IA por su nombre. GPTBot, ClaudeBot, PerplexityBot, Google-Extended y los demás. Que se nombre a uno ya es la señal: significa que alguien decidió, en vez de heredar lo que viniera por defecto. Si permitieron o bloquearon se informa, nunca se juzga.

Content Signals. La convención más reciente para decir qué puede hacer un rastreador con lo que se lleva: buscar, entrenar o responder directamente. Publicada o no, conviene saber cuál de las dos.

Qué puede hacer realmente

  • Un catálogo de API. Si existe /.well-known/api-catalog, que es como un sitio le dice a un agente qué ofrece en lugar de dejar que lo adivine a partir del HTML.
  • MCP y habilidades de agente. Una ficha de servidor en /.well-known/mcp o un índice de habilidades: las dos maneras de que un sitio entregue a un agente sus propios procedimientos en vez de confiar en que los deduzca.
  • Peticiones firmadas. Si el sitio está preparado para verificar firmas de mensajes HTTP, que es como acabará distinguiendo un agente real de algo que lleva puesto su user agent.

Casi nada publica esto todavía. Justo por eso merece la pena tener la comprobación ahora: la respuesta de hoy para toda la cartera es una línea base, y el primer cliente que pregunte preguntará contra ella.

Preguntas

¿Esto mejora mi posición en las respuestas de IA?

No, y quien te diga que un archivo .well-known lo hará te está vendiendo algo. Publicar estas convenciones hace que un sitio sea más barato y más fiable de leer para un agente que ya quiere leerlo. Lo que hace que se cite un sitio es lo mismo de siempre: ser la respuesta más clara disponible.

¿Es llms.txt un estándar de verdad?

Es una convención con adopción real, no un estándar ratificado, y lo mismo vale para casi todo lo que se revisa aquí. Se dice claramente en lugar de disimularlo: esta es un área joven, y una herramienta de monitorización que presente una propuesta como un requisito está haciendo lo mismo que le critica a los escáneres de cabeceras.

¿Debería bloquear a los rastreadores de IA?

Es una decisión sobre el negocio de tu cliente, no una decisión técnica, y esto no la tomará por ti. Lo que sí hará es decirte qué dice hoy cada sitio, para que la decisión sea al menos deliberada.

¿La propia comprobación respeta robots.txt?

El rastreador de este servicio se identifica en su user agent y pide solo la página de inicio del sitio, su robots.txt y el puñado de rutas .well-known listadas arriba. No recorre el sitio entero.

¿En qué plan está incluido?

En todos, incluido el gratuito. Todas las comprobaciones se ejecutan en todos los planes para todos los sitios.