Rastreadores de IA: a quién dejar entrar en tu sitio y cómo verificarlo

Aprende a identificar rastreadores de IA, verificar su user-agent e IP, y decidir con criterio a quién permites rastrear tu sitio.

Equipo editorial de ADS BeastPublicado 8 min de lectura

Los rastreadores de IA son agentes que visitan tu web para alimentar respuestas de ChatGPT, Perplexity, Copilot, Gemini y similares. Verificarlos consiste en comprobar tres señales: el user-agent, la IP declarada por el proveedor y el comportamiento de la petición. Con eso decides caso por caso a quién dejas pasar.

En resumen

  • Un rastreador de asistentes registra visitas que llegan desde asistentes de IA; un rastreador normal las agrupa como referencia genérica, canal directo o bot.
  • La diferencia práctica está en el user-agent y en la IP de origen, no en el contenido de la página.
  • robots.txt declara intenciones, pero el bloqueo real ocurre en el servidor o en el CDN.
  • Un agente mal identificado puede extraer tu contenido sin devolverte ninguna visita.
  • La verificación se repite cuando el proveedor cambia sus rangos de IP.

Qué es un rastreador de asistentes y en qué se diferencia de un rastreador normal

Un rastreador de asistentes es un agente que consulta tu web para construir o citar respuestas dentro de un asistente de IA. Un rastreador normal, en cambio, suele alimentar índices de buscadores. La diferencia no está en lo que leen, sino en cómo se identifican y qué hacen con lo que encuentran.

En la práctica, un rastreador normal aparece en tu analítica como referencia, como tráfico directo o directamente como bot. La visita se pierde en un cajón genérico y no puedes atribuirla a nada concreto. Un rastreador de asistentes, si lo tienes identificado, te deja ver qué páginas consulta, con qué frecuencia y si esa consulta acaba generando una cita de tu contenido en una respuesta.

Esa distinción importa porque el valor de cada visita es distinto. Una visita de un buscador puede traerte un clic. Una visita de un asistente puede traerte una mención, un enlace citado o nada. Para entender cómo se comporta ese tráfico en tus informes, conviene revisar cómo se identifica el tráfico desde ChatGPT en analítica.

Verificar un rastreador de IA. User-agent: Compáralo con la lista pública del proveedor; IP de origen: Debe pertenecer al rango declarado por el proveedor; Comportamiento: Una petición, sin CSS ni imágenes, sin sesión previa; Frecuencia: Un rastreo ordenado no se parece a un raspado masivo; Rutas vi
Tres señales que se comprueban juntas, nunca por separado.

Cómo verificar si un rastreador de IA es legítimo

La verificación se apoya en tres capas, y ninguna basta por sí sola. El user-agent es el punto de partida, la IP declarada es la confirmación y el comportamiento es el desempate.

Muchos proveedores publican la lista de sus rastreadores con el identificador que usan y, en varios casos, los rangos de IP desde los que salen. Comparar la petición que recibes con esa lista es el método más directo. Si el identificador coincide pero la IP no pertenece al rango declarado, tienes un problema: alguien está suplantando al agente.

El comportamiento añade contexto. Un rastreador legítimo suele pedir una sola página, no carga CSS ni imágenes y no arrastra sesión previa. Si ves ese patrón desde una IP desconocida y con un user-agent que imita a un navegador normal, la señal fiable que te queda es el patrón de peticiones, no la cabecera.

Señales que puedes revisar sin herramientas especiales

  1. El user-agent de la petición, comparado con la lista pública del proveedor.
  2. La IP de origen, contrastada con los rangos que el proveedor declara.
  3. El patrón de la visita: una sola petición, sin recursos estáticos, sin cookies previas.
  4. La frecuencia: un rastreo ordenado no se comporta como un raspado masivo.
  5. El destino: qué rutas visita y si esas rutas coinciden con tu contenido público.

Si quieres medir el efecto de esas visitas en tu visibilidad, el seguimiento de la cuota de voz de tu marca con IA te da la otra mitad del cuadro: no solo quién entra, sino cuánto te citan.

Dejar entrar o bloquear. Identificado y IP correcta: Dejar pasar y medir qué páginas visita; Identificado pero IP distinta: Bloquear: hay suplantación del proveedor; Imita a un navegador normal: Decidir por comportamiento, no por cabecera; Solo consume ancho de banda: Restringir rutas pesadas, no to
La decisión se toma por caso, no con una regla única.

A quién conviene dejar entrar y a quién no

No hay una respuesta única. La decisión depende de si ese rastreo te devuelve visitas, citas o enlaces, o si solo consume ancho de banda y contenido.

Un agente que cita tu web con enlace trabaja a tu favor: te da visibilidad dentro de una respuesta que otro usuario está leyendo. Un agente que copia sin citar no te devuelve nada medible. Entre esos dos extremos hay casos ambiguos, y ahí es donde conviene decidir por ruta y no por agente completo.

SituaciónQué conviene hacerPor qué
El agente está identificado y su IP coincide con el rango declaradoDejarlo pasar y medir qué páginas visitaPuedes atribuir el rastreo y valorar si genera citas
El agente se identifica pero la IP no coincideBloquear por IP o por user-agentHay suplantación: alguien usa el nombre del proveedor
El agente imita a un navegador normalDecidir por comportamiento, no por cabeceraBloquear por user-agent puede cortar usuarios legítimos
Solo consume ancho de banda sin tráfico medibleRestringir rutas pesadasReduces coste sin cerrar el acceso al contenido útil
Es un agente nuevo que no conocíasObservar antes de bloquearPuede ser un rastreador legítimo aún no documentado

La lógica de fondo es sencilla: deja entrar a quien te cita, frena a quien solo copia, y observa antes de bloquear cuando no tengas certeza.

Dónde se configura el acceso en tu web

El control básico está en el archivo robots.txt, donde indicas qué agentes pueden rastrear cada ruta. Ahí declaras tu intención, pero no aplicas una barrera.

robots.txt es una convención, no un mecanismo de seguridad. Un agente que decida ignorarlo entrará igual. El bloqueo real se aplica en el servidor o en el CDN, por user-agent o por rango de IP. Si usas un WAF o un panel de hosting, revisa primero si ya trae reglas para agentes de IA antes de escribir las tuyas: duplicar reglas genera conflictos difíciles de depurar.

Si quieres declarar de forma explícita qué puede usar un modelo de tu contenido, el archivo llms.txt: qué es y qué escribir en tu archivo cubre esa parte. Es otra convención, con el mismo límite: orienta, no obliga.

Cómo se aplica el bloqueo en la práctica

  1. Define en robots.txt qué agentes y qué rutas permites.
  2. Revisa si tu CDN o WAF ya incluye reglas para agentes de IA.
  3. Aplica el bloqueo real en el servidor, por user-agent o por rango de IP.
  4. Registra las peticiones bloqueadas para detectar falsos positivos.
  5. Revisa la lista cada vez que un proveedor anuncie cambios en sus rangos.

El paso cuatro es el que más se salta la gente. Sin registro, no sabes si has cortado a un visitante legítimo hasta que ves una caída en el tráfico y no encuentras la causa.

Qué hacer si un rastreador de asistente entra sin identificarse

Puedes bloquearlo por user-agent o por rango de IP en el servidor, o dejarlo pasar y medir qué páginas visita. La decisión depende de si ese tráfico te aporta algo o solo consume recursos.

El riesgo de bloquear por user-agent es evidente: si el agente se disfraza de navegador, cortas también a usuarios reales. Cuando no distingues al agente del visitante humano, el bloqueo por cabecera es un tiro al aire.

La alternativa es medir primero. Registra las peticiones sospechosas, mira qué rutas tocan y con qué frecuencia, y decide después. Si el patrón es de raspado masivo, el bloqueo se justifica. Si es una visita puntual a una página pública, el coste de dejarla pasar es bajo.

Cómo saber si el rastreo se traduce en visibilidad

El rastreo por sí solo no dice nada. Lo que importa es si ese contenido acaba citado en las respuestas que ve tu audiencia.

Para eso necesitas dos cosas: saber qué dicen las respuestas de IA sobre tu marca y saber si te citan a ti o a un competidor. Lo primero se comprueba con un método repetible, como el que se describe en qué dicen las respuestas de IA sobre tu empresa y cómo verificarlo. Lo segundo, cuando la respuesta cita a otro, se trabaja con las acciones que recoge la respuesta de la IA cita a un competidor: cómo revertirlo.

La conexión entre rastreo y cita no es automática. Un agente puede visitar tu web muchas veces y no citarte nunca. Otro puede citarte con una sola visita. Por eso conviene medir las dos capas por separado antes de sacar conclusiones.

Qué cambia según el proveedor y por qué hay que reverificar

Cada proveedor publica su propia lista de rastreadores y, cuando la publica, sus propios rangos de IP. No hay un estándar común.

Eso significa que la verificación caduca. Un rango de IP que hoy es válido puede cambiar mañana, y una regla de bloqueo escrita hace meses puede estar cortando a un agente legítimo o dejando pasar a uno que ya no lo es. La revisión periódica no es opcional si tomas decisiones de bloqueo.

El coste de no reverificar es asimétrico. Si dejas pasar de más, pierdes contenido y ancho de banda. Si bloqueas de más, pierdes citas y visibilidad sin enterarte, porque la ausencia de una mención no genera ninguna alerta.

Qué revisar en cada actualización del proveedor

  1. Si el identificador del agente cambió.
  2. Si los rangos de IP declarados siguen siendo los mismos.
  3. Si aparecieron agentes nuevos que antes no existían.
  4. Si tus reglas de bloqueo siguen apuntando a rangos vigentes.
  5. Si el volumen de peticiones bloqueadas subió sin motivo aparente.

Siguiente paso

Antes de tocar nada, haz un inventario: qué agentes entran hoy en tu sitio, con qué identificador y desde qué IP. Ese registro es la base de cualquier decisión posterior, y sin él solo estarás adivinando.

Si quieres ver ese rastro junto al resto de tus canales, en la página de visibilidad de tu marca en respuestas de IA puedes revisar el historial de menciones y cómo se compara con lo que ya mides en publicidad.