Tu sitio puede estar bloqueando a la IA sin que nadie lo haya decidido
- GEO
- AEO
- IA
Antes de optimizar nada para que la IA te cite, comprueba que la IA pueda entrar. Muchos sitios le devuelven un bloqueo a los crawlers de ChatGPT, Claude o Perplexity por la configuración por defecto de su CDN, no por una decisión de nadie. Se verifica desde afuera, con un comando, en dos minutos.
Cómo comprobarlo
Pide tu propia página haciéndote pasar por el crawler, y mira el código de respuesta:
for bot in GPTBot ClaudeBot PerplexityBot Googlebot; do
echo "$bot $(curl -s -o /dev/null -w '%{http_code}' -A "$bot" https://tudominio.com/)"
done
200 es que entra. 403 o 401 es que lo estás bloqueando. Hazlo también contra /robots.txt y contra alguna página interna, no solo contra la home: las reglas pueden aplicarse por ruta.
Por qué el robots.txt de tu repositorio no prueba nada
Porque puede no ser el que sirve el sitio. Algunos CDN ofrecen gestionar el robots.txt por ti, y cuando esa opción está activa reescriben el archivo en el camino. El del repositorio dice una cosa; el que llega al crawler dice otra.
Es el mismo principio que con cualquier cosa que pase por un intermediario: lo que vale es lo que sale, no lo que escribiste.
Nos pasó a nosotros
Es incómodo de contar y es la razón por la que este post existe.
Hasta el 24 de agosto de 2026, sonika.space estaba bloqueando a los crawlers de IA. En dos capas a la vez, y ninguna de las dos la había puesto nadie a propósito:
| Capa | Qué estaba activo | Qué hacía |
|---|---|---|
| Bots | Bloqueo de bots de entrenamiento de IA | Le devolvía un bloqueo al crawler |
| robots.txt | Gestión del robots.txt desde el CDN | Reescribía el del repositorio, que decía que sí |
La segunda es la que enseña algo. Nuestro robots.txt decía explícitamente que queríamos ser leídos y citados. El CDN lo estaba sustituyendo antes de que llegara a nadie.
Y hay un detalle que cuesta encontrar: la opción intermedia que ofrece Cloudflare —una política de señales de contenido— saca los Disallow pero deja marcado que no se permite el entrenamiento. Para destrabarlo hubo que desactivar la gestión entera.
El 25 de agosto consultamos quince user-agents contra tres rutas y registramos el código: los quince responden 200. El robots.txt en vivo volvió a ser el del repositorio.
Los crawlers ya no son una sola cosa
Cloudflare dejó de tratarlos como un bloque y los separó por lo que hacen con el contenido después de leerlo. Sus tres categorías, con su definición:
| Categoría | Qué hace |
|---|---|
| Search | Recoge e indexa tu contenido para poder responder preguntas sobre él más adelante |
| Agent | Actúa en tiempo real por encargo de una persona que pidió algo ahora |
| Training | Toma tu contenido para entrenar o afinar un modelo |
La distinción importa porque son decisiones distintas. Que no quieras que tu contenido entre en el entrenamiento de un modelo no implica que no quieras aparecer cuando alguien pregunta por tu categoría.
La trampa: bloquear el entrenamiento también bloquea a Google
Este es el detalle que casi no se menciona, y es textual de Cloudflare:
«Multi-purpose crawlers such as Googlebot, Applebot, and BingBot will be blocked by customers who have selected to block Training.»
Un crawler que hace las dos cosas se evalúa bajo las dos políticas. Así que marcar «bloquear entrenamiento» —que suena a prudencia— también te saca de la indexación de búsqueda de Google, Apple y Bing.
Sobre el 15 de septiembre de 2026 conviene ser exacto, porque circula agrandado: Cloudflare fija defaults nuevos ese día, solo para dominios que entren a partir de entonces y solo en páginas con publicidad, donde Training y Agent quedan bloqueados. Search sigue permitido. Un dominio que ya está no cambia solo.
Lo que no sabemos
- No sabemos si desbloquear sirvió. No estábamos midiendo antes y la reindexación lleva semanas. No tenemos una cifra y no vamos a inventarla.
- No sabemos cuánto tiempo estuvimos bloqueados. Lo detectamos en julio; cuándo empezó, no consta.
- No sabemos cuántos sitios están así. Es tentador decir «le pasa a todo el mundo». No tenemos el dato.
- Que un crawler entre no significa que te cite. Es condición necesaria y nada más. Todo lo demás —la estructura, las respuestas directas, la evidencia— sigue haciendo falta.
Qué hacer con esto
Corre el comando contra tu dominio. Si todo responde 200, ya está y te tomó dos minutos. Si algo responde 403, ahora sabes por qué la IA no te menciona, y la causa probablemente no la eligió nadie.
Si quieres el marco completo de por qué esto importa, está en GEO: cómo lograr que la IA cite a tu empresa.
Fuentes
- Your site, your rules: new AI traffic options for all customers
De acá salen las tres clasificaciones, la fecha del cambio de defaults y las dos citas textuales que reproduce este post.
- AI Crawl Control — documentación
Declara que está disponible en todos los planes. No documenta la ruta del panel ni las opciones por categoría, y por eso este post no las afirma.
- Comprobación propia sobre sonika.space
Quince user-agents contra tres rutas, registrando el código de respuesta. No es una fuente externa: es nuestra medición, y se dice.
Preguntas frecuentes
¿Por qué ChatGPT no encuentra mi sitio web?
La causa más común no es el contenido: es que el sitio le devuelve un bloqueo al crawler. Muchos CDN traen activada por defecto una opción que bloquea a los bots de IA, así que el bloqueo existe sin que nadie lo haya decidido. Se comprueba en dos minutos con un comando.
¿Cómo compruebo si mi sitio bloquea a los crawlers de IA?
Pide tu propia página usando el user-agent del crawler y mira el código de respuesta: `curl -s -o /dev/null -w '%{http_code}' -A GPTBot https://tudominio.com/`. Un 200 significa que entra. Un 403 o un 401 significan que lo estás bloqueando. Repítelo con ClaudeBot, PerplexityBot y Googlebot.
¿El robots.txt de mi repositorio es suficiente para saberlo?
No. Algunos CDN reescriben el robots.txt en el camino, así que el archivo del repositorio puede decir que permites el acceso mientras el sitio sirve otro que lo niega. La única comprobación válida es contra la URL pública, con el CDN en el medio.
¿Debería bloquear a los crawlers de IA?
Depende de qué vives. Si vives de tu contenido, bloquear el entrenamiento es una decisión defendible. Si quieres que la IA te mencione, bloquearlos te saca de esa conversación. Y hay un costo que conviene saber: Cloudflare advierte que bloquear los crawlers de entrenamiento bloquea también a Googlebot, Applebot y BingBot.
¿Qué cambia el 15 de septiembre de 2026 en Cloudflare?
Cloudflare fija defaults nuevos para sus tres categorías de bot: Search, Agent y Training. El cambio aplica solo a los dominios nuevos que entren a Cloudflare y solo en páginas con publicidad, donde Training y Agent quedan bloqueados. Search sigue permitido, y los dominios existentes no cambian solos.