Desde 2023, muchos sitios añadieron los bots de IA a su archivo robots.txt para impedir que su contenido se usara en el entrenamiento de los modelos. La intención era razonable, pero en la práctica se pasó por alto una distinción crítica: dentro de una misma empresa, el bot de entrenamiento y el bot de búsqueda y respuesta son agentes distintos. Cuando se bloquean los dos a la vez, no solo se sale de los datos de entrenamiento: también se destruye la posibilidad de que se le cite como fuente en las respuestas.
Dos tipos de bot distintos
| Tipo | Qué hace | Si se bloquea |
|---|---|---|
| Bot de entrenamiento | Recopila el contenido para usarlo en el entrenamiento del modelo | La visibilidad no se ve afectada directamente |
| Bot de búsqueda y respuesta | Trae el contenido actualizado cuando alguien hace una pregunta | No se le cita como fuente en las respuestas |
Bots críticos para la visibilidad
- OAI-SearchBot — necesario para que ChatGPT pueda mostrar su sitio en los resultados de búsqueda.
- ChatGPT-User — lee su página cuando alguien abre un enlace.
- PerplexityBot y Perplexity-User — necesarios para que se le cite como fuente en las respuestas de Perplexity.
- ClaudeBot, Claude-User, Claude-SearchBot — rastreo y recuperación en el lado de Claude.
- Googlebot — el rastreador básico tanto para la búsqueda clásica como para AI Overviews.
- Bingbot — gran parte de las respuestas de Copilot se alimenta del índice de Bing.
En cambio, GPTBot (entrenamiento de OpenAI), Google-Extended (entrenamiento de Gemini) y Applebot-Extended (entrenamiento de Apple Intelligence) no son bots de visibilidad directa. Bloquearlos no impide por sí solo que se le mencione en las respuestas.
Regla práctica: si no quiere que su contenido se use en el entrenamiento de los modelos, pero sí quiere que se le mencione en las respuestas, bloquee los bots de entrenamiento y deje libres los de búsqueda y respuesta.
Ejemplo de configuración
# Bots de entrenamiento bloqueados
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
# Bots de búsqueda y respuesta permitidos
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
Sitemap: https://ornek.com/sitemap.xmlrobots.txt no es el único obstáculo
- Las reglas de CDN y WAF (como la gestión de bots de Cloudflare) pueden bloquear los bots de IA con independencia del robots.txt.
- Las reglas del servidor que devuelven un 403 según el user-agent crean invisibilidad en silencio.
- Algunos bots no pueden leer el contenido que solo se genera con JavaScript.
- El contenido que está detrás de un muro de inicio de sesión nunca puede citarse como fuente.
Por eso la auditoría no debe limitarse al robots.txt: hay que examinar también las reglas de CDN, los registros del servidor y el estado del renderizado en el servidor.