robots.txt para bots de IA: qué permite y qué bloquea cada directiva
Muchas organizaciones bloquean a los rastreadores de modelos de lenguaje sin saberlo, porque el bloqueo vino en la configuración por defecto de un plugin. Esta guía explica qué agente corresponde a cada motor.
El mapa de agentes
| Agente | Organización | Para qué se usa |
|---|---|---|
| GPTBot | OpenAI | Rastreo para entrenamiento de modelos |
| OAI-SearchBot / ChatGPT-User | OpenAI | Recuperación en tiempo real al responder |
| ClaudeBot / anthropic-ai | Anthropic | Rastreo e indexación |
| PerplexityBot | Perplexity | Índice de búsqueda con citación de fuentes |
| Google-Extended | Control específico para usos de IA generativa | |
| CCBot | Common Crawl | Corpus público usado por múltiples modelos |
La distinción relevante es entre los agentes de entrenamiento y los de recuperación en tiempo real. Bloquear los primeros no impide aparecer citado; bloquear los segundos sí.
La decisión no es técnica, es de negocio
Una editorial que vive de suscripciones tiene motivos legítimos para restringir el uso de su archivo en entrenamiento. Una empresa de servicios B2B que quiere ser encontrada tiene el incentivo contrario: cada bloqueo es una puerta cerrada a un canal de descubrimiento en crecimiento.
El problema real no es elegir una u otra postura, sino tenerla por defecto sin haberla decidido. Verifique qué dice hoy el archivo de su dominio antes de cualquier otra acción de posicionamiento.
Configuración recomendada para una empresa de servicios
Permitir de forma explícita los agentes de recuperación y de rastreo, declarar la ubicación del mapa del sitio, y evitar reglas comodín heredadas que bloqueen sin intención.
Conviene además que la declaración sea explícita por agente y no solo un permiso general: deja constancia de una decisión tomada, y evita que un cambio futuro en las reglas por defecto de una herramienta altere el comportamiento sin aviso.
Lo que robots.txt no hace
No es un mecanismo de seguridad. No impide el acceso a contenido; solo expresa una preferencia que los agentes respetuosos acatan. Información que no debe ser pública no se protege con una directiva de rastreo, sino con autenticación.
Tampoco elimina contenido ya incorporado a un corpus anterior. Un cambio en las directivas afecta al rastreo futuro, no al pasado.
¿Sabe si su sitio está bloqueando a los motores de IA?
Escríbanos con el contexto de su organización. Respondemos con criterio técnico, no con un formulario de ventas.
Contactar