---
title: "Краулеры ассистентов: кого пускать на сайт и как проверить"
description: "Разбираем, как отличить краулеры ассистентов от поисковых ботов, где взять списки IP, как настроить robots.txt и лимиты запросов на сервере."
canonical: https://adsbeast.pro/blog/ru/kraulery-assistentov-kogo-puskat-na-sayt-i-kak-proverit
language: ru
published: 2026-09-11T03:23:15.674Z
updated: 2026-09-15T07:28:14.450Z
author: "Редакция ADS Beast"
translations:
  - ar: https://adsbeast.pro/blog/ar/assistant-crawlers-who-to-allow-and-how-to-verify
  - en: https://adsbeast.pro/blog/en/assistant-crawlers-who-to-allow-and-how-to-verify
  - es: https://adsbeast.pro/blog/es/rastreadores-de-asistentes-cuales-dejar-entrar
  - he: https://adsbeast.pro/blog/he/assistant-crawlers-who-to-allow-and-how-to-verify
  - sk: https://adsbeast.pro/blog/sk/pavuky-asistentov-koho-pustit-na-web-a-ako-overit
  - uk: https://adsbeast.pro/blog/uk/krauleri-asistentiv-kogo-puskati-na-sayt-i-yak-pereviriti
---
# Краулеры ассистентов: кого пускать на сайт и как проверить

Краулеры ассистентов - это боты AI-сервисов (GPTBot, ClaudeBot, PerplexityBot и другие), которые забирают содержимое страниц, чтобы потом отвечать на вопросы пользователей. Пускать их или нет - решение про трафик и контроль, а не про технологию. Проверка сводится к трём вещам: User-Agent, IP и обратный DNS.

Коротко:

- Краулеры ассистентов отличаются от поисковых ботов: у первых нет публичной сертификации запросов, как у Googlebot.
- Один User-Agent ничего не доказывает. Его подделывают скраперы.
- Настоящий бот подтверждается связкой: IP из официального диапазона плюс обратный DNS, который указывает на домен вендора.
- Решение «пускать или блокировать» зависит от модели монетизации: охват в AI-ответах против защиты уникального контента.
- Ограничить нагрузку можно в robots.txt через Crawl-delay и на сервере через rate limit.

## Чем краулеры ассистентов отличаются от поисковых ботов

Краулеры ассистентов собирают контент не для индекса поиска, а для генерации ответов в чат-интерфейсе. Поисковый бот приводит пользователя на сайт по ссылке из выдачи. Краулер ассистента приводит цитату или пересказ внутри ответа, и переход по ссылке случается далеко не всегда.

Отсюда практическая разница. Googlebot и YandexBot ходят с подтверждённых IP-диапазонов, и принадлежность запроса проверяется обратным DNS-запросом: имя хоста должно заканчиваться на домене поисковика, а прямой DNS этого хоста - возвращать тот же IP. У краулеров ассистентов та же логика проверки работает, но сами вендоры публикуют списки менее строго и обновляют их реже.

Есть и вторая разница: назначение обхода. Поисковик обходит сайт, чтобы показать сниппет и отправить трафик. Ассистент обходит сайт, чтобы использовать текст как источник в ответе. Для сайта с подпиской или платным контентом это принципиально разные вещи.

## Как проверить, что запрос пришёл от настоящего краулера

Проверка состоит из трёх шагов, и пропускать средний нельзя. User-Agent легко подделать, IP подделать сложнее, а связка «IP + обратный DNS + прямой DNS» даёт почти полную уверенность.

1. Посмотрите User-Agent в логах сервера. GPTBot, ClaudeBot, PerplexityBot и их аналоги заявляют себя в строке запроса. Это только первый фильтр, а не доказательство.
2. Сверьте IP с официальным списком диапазонов вендора. Если адрес не попадает ни в один опубликованный диапазон, это повод насторожиться.
3. Сделайте обратный DNS-запрос по IP. У настоящего бота хост должен заканчиваться на домене вендора. Затем сделайте прямой DNS по этому хосту и убедитесь, что он возвращает исходный IP. Несовпадение означает подделку.

Третий шаг закрывает основную дыру. Скрапер может подставить в User-Agent строку GPTBot и ходить с любого адреса. Но он не сможет заставить обратный DNS чужого IP отвечать именем хоста в домене openai.com.

Если в логах видно, что запросы приходят с одного IP-диапазона, но обратный DNS у него пустой или указывает на хостинг-провайдера, а не на вендора, это почти наверняка не ассистент. Такой трафик блокируется без сожалений.

## Кого пускать: решение по типу сайта

Универсального ответа нет. Всё упирается в то, как сайт зарабатывает. Если деньги приходят из показов рекламы и переходов, доступ краулерам ассистентов расширяет охват. Если деньги приходят из подписки на уникальный контент, бесплатная выдача этого контента в ответах ассистента работает против вас.

| Тип сайта | Пускать краулеры ассистентов | Почему |
|---|---|---|
| Медиа и блоги с рекламой | Да | Рост цитируемости в AI-ответах даёт дополнительную видимость |
| Интернет-магазины | Да, но следить за нагрузкой | Карточки и описания попадают в ответы на запросы о товарах |
| SaaS с бесплатным тарифом | Да | Ассистенты приводят пользователей на верх воронки |
| Сайты с платной подпиской | Зависит от доли платного контента | Публичные страницы можно открыть, закрытые разделы - нет |
| Сайты с уникальными исследованиями | Решение за владельцем | Ценность в первоисточнике, пересказ в ответе её размывает |

Отдельно стоит вопрос про трафик. Даже если вы решили пускать ботов, стоит отслеживать, сколько ресурсов они потребляют. Краулер может обходить архивные страницы, которых нет в sitemap, и создавать нагрузку на базу данных. Это лечится настройками, а не полной блокировкой.

## Что будет, если закрыть сайт от краулеров ассистентов

Ассистент перестанет брать контент с вашего сайта и в ответах начнёт ссылаться на другие источники. Для сайтов, которые монетизируются через трафик, это снижает видимость в AI-выдаче. По данным Similarweb, доля переходов из чат-ботов за 2024 год выросла в разы, и эта доля продолжает расти.

Если контент уникальный и вы продаёте подписку, блокировка часто оправдана: вы не отдаёте актив бесплатно. Если цель - охват и узнаваемость, лучше оставить доступ и следить за нагрузкой. Промежуточный вариант - открыть только те разделы, которые и так публичны, а закрыть материалы для подписчиков.

Здесь есть тонкость. Блокировка через robots.txt - это вежливая просьба, а не технический запрет. Добросовестные краулеры её соблюдают, скраперы игнорируют. Если нужен жёсткий контроль, robots.txt дополняется блокировкой по IP на уровне сервера или WAF.

## Как ограничить нагрузку от краулеров

Интенсивность обхода зависит от размера сайта. Типичный GPTBot обходит от нескольких сотен до десятков тысяч страниц в сутки. Жёсткого лимита вендоры не публикуют, поэтому ограничения ставит владелец сайта.

В robots.txt можно задать Crawl-delay - паузу между запросами. Не все боты его уважают, но большинство крупных вендоров учитывает. На уровне сервера лимит ставится по IP или User-Agent: в Nginx это делается через limit_req_zone, на Cloudflare - через правила WAF. Если бот игнорирует лимиты и продолжает долбить сайт, блокируйте диапазон целиком.

Полезно логировать обходы отдельно от обычного трафика. Тогда видно, сколько страниц в сутки забирает каждый бот и растёт ли эта цифра. Часто проблема не в самом краулере, а в том, что он находит тысячи параметризованных URL через фильтры и пагинацию. Закрытие таких URL в robots.txt снижает нагрузку сильнее, чем общий rate limit.

Настройка доступа - часть более широкой работы с видимостью. Если вы ведёте несколько проектов и хотите передать техническую часть подрядчику, посмотрите [рекламные операции для агентств](/).

## Где взять официальные списки IP и как их поддерживать

Каждый вендор публикует диапазоны на своём сайте. OpenAI держит файл на platform.openai.com в разделе документации по ботам. Anthropic публикует список на support.anthropic.com. Google описывает диапазоны в справке по Googlebot и Google-Extended.

Списки обновляются, поэтому раз в месяц их стоит перепроверять. Вручную это быстро надоедает, и появляется соблазн забить. Практичнее подтягивать диапазоны скриптом: скачивать файл, парсить и обновлять правила на сервере или в WAF. Тогда проверка не зависит от того, вспомнил ли кто-то зайти на сайт вендора.

Если бот приходит с IP, которого нет в официальном списке, причин две. Либо это подделка: скрапер маскируется под GPTBot. Либо вендор расширил инфраструктуру и не обновил публичный список. Различить помогает обратный DNS: у настоящего GPTBot хост заканчивается на openai.com, у подделки - нет. Если обратный DNS не совпадает с прямым, запрос почти наверняка не от вендора.

## Как связать доступ краулеров с аналитикой

Открытый доступ к контенту для ассистентов меняет картину трафика, и это стоит учитывать при разборе статистики. Переходы из чат-ботов часто попадают в категорию «прямые» или «переходы по ссылкам», а не в органику. Из-за этого цифры в отчётах не сходятся с ожиданиями, и полезно понимать, [почему цифры в статистике разные - окно атрибуции](/blog/ru/okno-atributsii-pochemu-tsifry-v-statistike-raznye).

Если вы отслеживаете конверсии из AI-трафика, настройте передачу событий корректно, чтобы не задваивать заявки: [серверная передача конверсий без двойного счёта](/blog/ru/servernaya-peredacha-konversiy-kak-vklyuchit-bez-dvoynogo-schyota). А чтобы решения по ставкам и бюджетам опирались на достаточный объём данных, а не на шум, пригодится материал о том, [когда данных достаточно, чтобы отключить объявление](/blog/ru/kogda-dannykh-dostatochno-chtoby-otklyuchit-obyavlenie).

Отдельная задача - понять, что именно ассистенты рассказывают о вашей компании. Это проверяется не в логах, а запросами к самим ассистентам: [что о компании говорят ответы ИИ - проверка репутации](/blog/ru/chto-o-kompanii-govoryat-otvety-ii-proverka-reputatsii). И если вы хотите управлять тем, что боты видят в первую очередь, стоит завести служебный файл: [llms.txt: зачем сайту этот файл и что в него писать](/blog/ru/llms-txt-zachem-saytu-etot-fayl-i-chto-v-nego-pisat).

## Следующий шаг

Проверьте текущие логи за последние сутки и выпишите всех ботов, которые заходили на сайт. Для каждого определите, подтверждается ли он обратным DNS и попадает ли его IP в официальный список вендора. После этого примите решение по каждому: пускать, ограничивать или блокировать. Начать удобно с настройки отдельного лога для ботов, чтобы дальше работать с фактами, а не с догадками.

## FAQ

**Как отличить краулер AI-ассистента от обычного поискового бота?**

Смотрите на User-Agent и на IP, с которых приходит запрос. Поисковые боты вроде Googlebot и YandexBot ходят с подтверждённых диапазонов, которые проверяются обратным DNS-запросом. Краулеры ассистентов (GPTBot, ClaudeBot, PerplexityBot) часто маскируются под обычные браузеры, поэтому одного User-Agent недостаточно. Сверяйте IP с опубликованными списками владельца бота.

**Где посмотреть официальный список IP-адресов краулеров OpenAI, Anthropic и Google?**

Каждый вендор публикует диапазоны на своём сайте. OpenAI держит файл на platform.openai.com в разделе документации по ботам, Anthropic - на support.anthropic.com, Google - в справке по Google-Extended и Googlebot. Списки обновляются, поэтому раз в месяц их стоит перепроверять. Автоматически подтягивать диапазоны удобнее через скрипт, чем вручную.

**Что будет, если закрыть сайт от краулеров ассистентов через robots.txt?**

Ассистент перестанет брать контент из вашего сайта и в ответах начнёт ссылаться на другие источники. Для сайтов с монетизацией через трафик это снижает видимость в AI-выдаче, которая растёт: по данным Similarweb, доля переходов из чат-ботов за 2024 год выросла в разы. Если контент уникальный и вы продаёте подписку, блокировка часто оправдана. Если цель - охват, лучше оставить доступ и следить за нагрузкой.

**Сколько запросов в сутки может присылать краулер ассистента и как это ограничить?**

Интенсивность зависит от размера сайта: типичный GPTBot обходит от нескольких сотен до десятков тысяч страниц в сутки. Жёсткого лимита вендоры не публикуют, но в robots.txt можно задать Crawl-delay, а на уровне сервера - rate limit по IP или User-Agent. На Nginx это делается через limit_req_zone, на Cloudflare - через правила WAF. Если бот игнорирует лимиты, блокируйте диапазон целиком.

**Почему краулер ассистента может прийти с IP, которого нет в официальном списке?**

Причины две: либо это подделка (скрапер маскируется под GPTBot), либо вендор расширил инфраструктуру и не обновил публичный список. Проверка через обратный DNS решает вопрос: у настоящего GPTBot хост заканчивается на openai.com, у подделки - нет. Если обратный DNS не совпадает с прямым, запрос почти наверняка не от вендора.

Посмотреть, как это устроено в ADS Beast: [краулеры ассистентов](/features/ru/ai-visibility).

## Вопросы и ответы

### Как отличить краулер AI-ассистента от обычного поискового бота?

Смотрите на User-Agent и на то, с каких IP приходит запрос. Поисковые боты вроде Googlebot и YandexBot ходят с подтверждённых диапазонов, которые можно проверить обратным DNS-запросом. Краулеры ассистентов (GPTBot, ClaudeBot, PerplexityBot) часто маскируются под обычные браузеры, поэтому одного User-Agent недостаточно. Сверяйте IP с опубликованными списками владельца бота.

### Где посмотреть официальный список IP-адресов краулеров OpenAI, Anthropic и Google?

Каждый вендор публикует диапазоны на своём сайте. OpenAI держит файл на platform.openai.com в разделе документации по ботам, Anthropic — на support.anthropic.com, Google — в справке по Google-Extended и Googlebot. Списки обновляются, поэтому раз в месяц их стоит перепроверять. Автоматически подтягивать диапазоны удобнее через скрипт, чем вручную.

### Что будет, если закрыть сайт от краулеров ассистентов через robots.txt?

Ассистент перестанет брать контент из вашего сайта и в ответах начнёт ссылаться на другие источники. Для сайтов с монетизацией через трафик это снижает видимость в AI-выдаче, которая растёт: по данным Similarweb, доля переходов из чат-ботов за 2024 год выросла в разы. Если контент уникальный и вы продаёте подписку, блокировка часто оправдана. Если цель — охват, лучше оставить доступ и следить за нагрузкой.

### Сколько запросов в сутки может присылать краулер ассистента и как это ограничить?

Интенсивность зависит от размера сайта: типичный GPTBot обходит от нескольких сотен до десятков тысяч страниц в сутки. Жёсткого лимита вендоры не публикуют, но в robots.txt можно задать Crawl-delay, а на уровне сервера — rate limit по IP или User-Agent. На Nginx это делается через limit_req_zone, на Cloudflare — через правила WAF. Если бот игнорирует лимиты, блокируйте диапазон целиком.

### Почему краулер ассистента может прийти с IP, которого нет в официальном списке?

Причины две: либо это подделка (скрапер маскируется под GPTBot), либо вендор расширил инфраструктуру и не обновил публичный список. Проверка через обратный DNS решает вопрос: у настоящего GPTBot хост заканчивается на openai.com, у подделки — нет. Если обратный DNS не совпадает с прямым, запрос почти наверняка не от вендора.

