---
title: "Rastreadores de IA: a quién dejar entrar y cómo verificarlo"
description: "Aprende a identificar rastreadores de IA, verificar su user-agent e IP, y decidir con criterio a quién permites rastrear tu sitio."
canonical: https://adsbeast.pro/blog/es/rastreadores-de-ia-a-quien-dejar-entrar-y-como-verificarlo
language: es
published: 2026-10-06T11:00:55.878Z
updated: 2026-10-06T13:49:28.786Z
author: "Equipo editorial de ADS Beast"
translations:
  - ar: https://adsbeast.pro/blog/ar/assistant-crawlers-who-to-allow-and-how-to-verify
  - en: https://adsbeast.pro/blog/en/assistant-crawlers-who-to-allow-and-how-to-verify
  - he: https://adsbeast.pro/blog/he/assistant-crawlers-who-to-allow-and-how-to-verify
  - ru: https://adsbeast.pro/blog/ru/kraulery-assistentov-kogo-puskat-na-sayt-i-kak-proverit
  - sk: https://adsbeast.pro/blog/sk/pavuky-asistentov-koho-pustit-na-web-a-ako-overit
  - uk: https://adsbeast.pro/blog/uk/krauleri-asistentiv-kogo-puskati-na-sayt-i-yak-pereviriti
---
# Rastreadores de IA: a quién dejar entrar en tu sitio y cómo verificarlo

Los rastreadores de IA son agentes que visitan tu web para alimentar respuestas de ChatGPT, Perplexity, Copilot, Gemini y similares. Verificarlos consiste en comprobar tres señales: el user-agent, la IP declarada por el proveedor y el comportamiento de la petición. Con eso decides caso por caso a quién dejas pasar.

## En resumen

- Un rastreador de IA es un bot que lee tus páginas para un asistente: unos recogen contenido para entrenar modelos (GPTBot, ClaudeBot), otros lo indexan para las búsquedas del asistente (OAI-SearchBot, PerplexityBot) y otros entran solo cuando un usuario lo pide (ChatGPT-User, Claude-User, Perplexity-User).
- Se distinguen por el user-agent y por la IP de origen, no por lo que leen.
- robots.txt declara intenciones, pero el bloqueo real ocurre en el servidor o en el CDN.
- Un agente mal identificado puede extraer tu contenido sin devolverte ninguna visita.
- La verificación se repite cuando el proveedor cambia sus rangos de IP.

## Qué es un rastreador de asistentes y en qué se diferencia de un rastreador normal

Un rastreador de asistentes es un agente que consulta tu web para construir o citar respuestas dentro de un asistente de IA. Un rastreador normal, en cambio, suele alimentar índices de buscadores. La diferencia no está en lo que leen, sino en cómo se identifican y qué hacen con lo que encuentran.

Los proveedores separan sus bots por función, y esa separación es la que te permite decidir. OpenAI documenta GPTBot (recoge contenido que puede usarse para entrenar modelos), OAI-SearchBot (muestra sitios en las búsquedas de ChatGPT) y ChatGPT-User (visita una página cuando un usuario lo pide), cada uno con su propia regla en robots.txt, según su [página de rastreadores](https://platform.openai.com/docs/bots). Anthropic hace lo mismo con [ClaudeBot, Claude-SearchBot y Claude-User](https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler), y Perplexity con [PerplexityBot y Perplexity-User](https://docs.perplexity.ai/guides/bots). Google-Extended es un caso aparte: no tiene user-agent propio, es un token de robots.txt con el que indicas si el contenido que Google ya rastrea puede usarse para entrenar Gemini, y no afecta a tu presencia en la Búsqueda, según la [documentación de Google](https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers). Estas visitas se ven en los registros del servidor o del CDN: ahí compruebas qué páginas consulta cada bot y con qué frecuencia.

Esa distinción importa porque el valor de cada visita es distinto. Una visita de un buscador puede traerte un clic. Una visita de un asistente puede traerte una mención, un enlace citado o nada. Para entender cómo se comporta ese tráfico en tus informes, conviene revisar cómo se identifica el [tráfico desde ChatGPT en analítica](/blog/es/trafico-desde-chatgpt-como-identificarlo-en-analitica).

## Cómo verificar si un rastreador de IA es legítimo

La verificación se apoya en tres capas, y ninguna basta por sí sola. El user-agent es el punto de partida, la IP declarada es la confirmación y el comportamiento es el desempate.

OpenAI, Anthropic y Perplexity publican la lista de sus rastreadores con el identificador que usan y las direcciones IP desde las que salen. Comparar la petición que recibes con esa lista es el método más directo. Si el identificador coincide pero la IP no pertenece al rango declarado, tienes un problema: alguien está suplantando al agente.

El comportamiento añade contexto. Un rastreador legítimo suele pedir una sola página, no carga CSS ni imágenes y no arrastra sesión previa. Si ves ese patrón desde una IP desconocida y con un user-agent que imita a un navegador normal, la señal fiable que te queda es el patrón de peticiones, no la cabecera.

### Señales que puedes revisar sin herramientas especiales

1. El user-agent de la petición, comparado con la lista pública del proveedor.
2. La IP de origen, contrastada con los rangos que el proveedor declara.
3. El patrón de la visita: una sola petición, sin recursos estáticos, sin cookies previas.
4. La frecuencia: un rastreo ordenado no se comporta como un raspado masivo.
5. El destino: qué rutas visita y si esas rutas coinciden con tu contenido público.

Si quieres medir el efecto de esas visitas en tu visibilidad, el [seguimiento de la cuota de voz de tu marca con IA](/blog/es/seo-con-ia-mide-la-cuota-de-voz-de-tu-marca) te da la otra mitad del cuadro: no solo quién entra, sino cuánto te citan.

## A quién conviene dejar entrar y a quién no

No hay una respuesta única. La decisión depende de si ese rastreo te devuelve visitas, citas o enlaces, o si solo consume ancho de banda y contenido.

Un agente que cita tu web con enlace trabaja a tu favor: te da visibilidad dentro de una respuesta que otro usuario está leyendo. Un agente que copia sin citar no te devuelve nada medible. Entre esos dos extremos hay casos ambiguos, y ahí es donde conviene decidir por ruta y no por agente completo.

| Situación | Qué conviene hacer | Por qué |
|---|---|---|
| El agente está identificado y su IP coincide con el rango declarado | Dejarlo pasar y medir qué páginas visita | Puedes atribuir el rastreo y valorar si genera citas |
| El agente se identifica pero la IP no coincide | Bloquear por IP o por user-agent | Hay suplantación: alguien usa el nombre del proveedor |
| El agente imita a un navegador normal | Decidir por comportamiento, no por cabecera | Bloquear por user-agent puede cortar usuarios legítimos |
| Solo consume ancho de banda sin tráfico medible | Restringir rutas pesadas | Reduces coste sin cerrar el acceso al contenido útil |
| Es un agente nuevo que no conocías | Observar antes de bloquear | Puede ser un rastreador legítimo aún no documentado |

La lógica de fondo es sencilla: deja entrar a quien te cita, frena a quien solo copia, y observa antes de bloquear cuando no tengas certeza. En la práctica eso suele traducirse en permitir los bots de búsqueda (OAI-SearchBot, PerplexityBot, Claude-SearchBot), porque OpenAI indica que un sitio que excluye a OAI-SearchBot no se muestra en las respuestas de búsqueda de ChatGPT, y en decidir aparte sobre los de entrenamiento (GPTBot, ClaudeBot, Google-Extended), que no condicionan esa visibilidad.

## Dónde se configura el acceso en tu web

El control básico está en el archivo robots.txt, donde indicas qué agentes pueden rastrear cada ruta. Ahí declaras tu intención, pero no aplicas una barrera.

robots.txt es una convención, no un mecanismo de seguridad. Un agente que decida ignorarlo entrará igual, y los bots que actúan a petición de un usuario no siempre lo siguen: Perplexity indica que Perplexity-User generalmente ignora las reglas de robots.txt. El bloqueo real se aplica en el servidor o en el CDN, por user-agent o por rango de IP. Hay un matiz: Anthropic advierte que bloquear sus direcciones IP no garantiza la exclusión, porque impide que el bot lea tu robots.txt. Si usas un WAF o un panel de hosting, revisa primero si ya trae reglas para agentes de IA antes de escribir las tuyas: duplicar reglas genera conflictos difíciles de depurar.

Si quieres declarar de forma explícita qué puede usar un modelo de tu contenido, el archivo [llms.txt: qué es y qué escribir en tu archivo](/blog/es/llms-txt-que-es-y-que-escribir-en-tu-archivo) cubre esa parte. Es otra convención, con el mismo límite: orienta, no obliga.

### Cómo se aplica el bloqueo en la práctica

1. Define en robots.txt qué agentes y qué rutas permites.
2. Revisa si tu CDN o WAF ya incluye reglas para agentes de IA.
3. Aplica el bloqueo real en el servidor, por user-agent o por rango de IP.
4. Registra las peticiones bloqueadas para detectar falsos positivos.
5. Revisa la lista cada vez que un proveedor anuncie cambios en sus rangos.

El paso cuatro es el que más se salta la gente. Sin registro, no sabes si has cortado a un visitante legítimo hasta que ves una caída en el tráfico y no encuentras la causa.

## Qué hacer si un rastreador de asistente entra sin identificarse

Puedes bloquearlo por user-agent o por rango de IP en el servidor, o dejarlo pasar y medir qué páginas visita. La decisión depende de si ese tráfico te aporta algo o solo consume recursos.

El riesgo de bloquear por user-agent es evidente: si el agente se disfraza de navegador, cortas también a usuarios reales. Cuando no distingues al agente del visitante humano, el bloqueo por cabecera es un tiro al aire.

La alternativa es medir primero. Registra las peticiones sospechosas, mira qué rutas tocan y con qué frecuencia, y decide después. Si el patrón es de raspado masivo, el bloqueo se justifica. Si es una visita puntual a una página pública, el coste de dejarla pasar es bajo.

## Cómo saber si el rastreo se traduce en visibilidad

El rastreo por sí solo no dice nada. Lo que importa es si ese contenido acaba citado en las respuestas que ve tu audiencia.

Para eso necesitas dos cosas: saber qué dicen las respuestas de IA sobre tu marca y saber si te citan a ti o a un competidor. Lo primero se comprueba con un método repetible, como el que se describe en [qué dicen las respuestas de IA sobre tu empresa y cómo verificarlo](/blog/es/que-dicen-las-respuestas-de-ia-sobre-tu-empresa-como-verificarlo). Lo segundo, cuando la respuesta cita a otro, se trabaja con las acciones que recoge [la respuesta de la IA cita a un competidor: cómo revertirlo](/blog/es/la-respuesta-de-la-ia-cita-a-un-competidor-como-revertirlo).

La conexión entre rastreo y cita no es automática. Un agente puede visitar tu web muchas veces y no citarte nunca. Otro puede citarte con una sola visita. Por eso conviene medir las dos capas por separado antes de sacar conclusiones.

## Qué cambia según el proveedor y por qué hay que reverificar

Cada proveedor publica su propia lista de rastreadores y, cuando la publica, sus propios rangos de IP. No hay un estándar común.

Eso significa que la verificación caduca. Un rango de IP que hoy es válido puede cambiar mañana, y una regla de bloqueo escrita hace meses puede estar cortando a un agente legítimo o dejando pasar a uno que ya no lo es. La revisión periódica no es opcional si tomas decisiones de bloqueo.

El coste de no reverificar es asimétrico. Si dejas pasar de más, pierdes contenido y ancho de banda. Si bloqueas de más, pierdes citas y visibilidad sin enterarte, porque la ausencia de una mención no genera ninguna alerta.

### Qué revisar en cada actualización del proveedor

1. Si el identificador del agente cambió.
2. Si los rangos de IP declarados siguen siendo los mismos.
3. Si aparecieron agentes nuevos que antes no existían.
4. Si tus reglas de bloqueo siguen apuntando a rangos vigentes.
5. Si el volumen de peticiones bloqueadas subió sin motivo aparente.

## Siguiente paso

Antes de tocar nada, haz un inventario: qué agentes entran hoy en tu sitio, con qué identificador y desde qué IP. Ese registro es la base de cualquier decisión posterior, y sin él solo estarás adivinando.

El paso siguiente es saber si esas visitas acaban en menciones: en la página de [visibilidad de tu marca en respuestas de IA](/features/es/ai-visibility) se explica cómo Ads Beast guarda el historial de menciones de la marca y avisa cuando cambian.

## Preguntas y respuestas

### ¿Qué es un rastreador de asistentes y en qué se diferencia de un rastreador normal?

Un rastreador de asistentes es un bot que lee tus páginas para un asistente de IA como ChatGPT, Claude o Perplexity, ya sea para entrenar modelos, para indexar contenido de sus búsquedas o para responder a la petición de un usuario. Un rastreador normal, como el de un buscador, alimenta un índice de resultados. Se distinguen por el user-agent y por la IP desde la que llega la petición, no por el contenido de la página.

### ¿Cómo sé si una petición viene del rastreador de un asistente de IA y no de otro bot?

Revisa el user-agent de la petición y compáralo con la lista de rastreadores que publica cada proveedor. Los rastreadores de los asistentes suelen presentarse con su propio identificador y, en muchos casos, con una IP incluida en la lista que publica el proveedor. Si el agente se disfraza de navegador normal, la única señal fiable que te queda es el patrón de comportamiento: una sola petición, sin cargar CSS ni imágenes, y sin sesión previa.

### ¿Qué hago si un rastreador de asistente entra en mi sitio sin identificarse?

Puedes bloquearlo por user-agent o por rango de IP en el servidor, o dejarlo pasar y medir qué páginas visita. La decisión depende de si ese tráfico te trae visitas reales o solo consume ancho de banda. Si no distingues el agente del visitante humano, bloquear por user-agent puede cortar también a usuarios legítimos.

### ¿Dónde se configura el acceso de los rastreadores de IA en mi web?

El control básico está en el archivo robots.txt, donde indicas qué agentes pueden rastrear cada ruta. A partir de ahí, el bloqueo real se aplica en el servidor o en el CDN, porque robots.txt es una convención y no una barrera técnica. Si usas un WAF o un panel de hosting, revisa si ya trae reglas para agentes de IA antes de escribir las tuyas.

### ¿Por qué conviene verificar los rastreadores de asistentes antes de dejarlos entrar?

Porque un agente mal identificado puede estar extrayendo tu contenido para entrenamiento o para respuestas de IA sin devolverte ninguna visita. Verificarlo te permite decidir caso por caso: dejar pasar al que cita tu web con enlace y frenar al que solo copia. La verificación se apoya en user-agent, IP declarada y comportamiento de la petición, y conviene repetirla cuando el proveedor cambie sus rangos.

