Краулеры ассистентов: кого пускать на сайт и как проверить

Разбираем, как отличить краулеры ассистентов от поисковых ботов, где взять списки IP, как настроить robots.txt и лимиты запросов на сервере.

Редакция ADS BeastОпубликовано Обновлено 8 мин чтения

Краулеры ассистентов - это боты AI-сервисов (GPTBot, ClaudeBot, PerplexityBot и другие), которые забирают содержимое страниц, чтобы потом отвечать на вопросы пользователей. Пускать их или нет - решение про трафик и контроль, а не про технологию. Проверка сводится к трём вещам: User-Agent, IP и обратный DNS.

Коротко:

  • Краулеры ассистентов отличаются от поисковых ботов: у первых нет публичной сертификации запросов, как у Googlebot.
  • Один User-Agent ничего не доказывает. Его подделывают скраперы.
  • Настоящий бот подтверждается связкой: IP из официального диапазона плюс обратный DNS, который указывает на домен вендора.
  • Решение «пускать или блокировать» зависит от модели монетизации: охват в AI-ответах против защиты уникального контента.
  • Ограничить нагрузку можно в robots.txt через Crawl-delay и на сервере через rate limit.

Чем краулеры ассистентов отличаются от поисковых ботов

Краулеры ассистентов собирают контент не для индекса поиска, а для генерации ответов в чат-интерфейсе. Поисковый бот приводит пользователя на сайт по ссылке из выдачи. Краулер ассистента приводит цитату или пересказ внутри ответа, и переход по ссылке случается далеко не всегда.

Отсюда практическая разница. Googlebot и YandexBot ходят с подтверждённых IP-диапазонов, и принадлежность запроса проверяется обратным DNS-запросом: имя хоста должно заканчиваться на домене поисковика, а прямой DNS этого хоста - возвращать тот же IP. У краулеров ассистентов та же логика проверки работает, но сами вендоры публикуют списки менее строго и обновляют их реже.

Есть и вторая разница: назначение обхода. Поисковик обходит сайт, чтобы показать сниппет и отправить трафик. Ассистент обходит сайт, чтобы использовать текст как источник в ответе. Для сайта с подпиской или платным контентом это принципиально разные вещи.

Как проверить, что запрос пришёл от настоящего краулера

Проверка состоит из трёх шагов, и пропускать средний нельзя. User-Agent легко подделать, IP подделать сложнее, а связка «IP + обратный DNS + прямой DNS» даёт почти полную уверенность.

  1. Посмотрите User-Agent в логах сервера. GPTBot, ClaudeBot, PerplexityBot и их аналоги заявляют себя в строке запроса. Это только первый фильтр, а не доказательство.
  2. Сверьте IP с официальным списком диапазонов вендора. Если адрес не попадает ни в один опубликованный диапазон, это повод насторожиться.
  3. Сделайте обратный DNS-запрос по IP. У настоящего бота хост должен заканчиваться на домене вендора. Затем сделайте прямой DNS по этому хосту и убедитесь, что он возвращает исходный IP. Несовпадение означает подделку.

Третий шаг закрывает основную дыру. Скрапер может подставить в User-Agent строку GPTBot и ходить с любого адреса. Но он не сможет заставить обратный DNS чужого IP отвечать именем хоста в домене openai.com.

Если в логах видно, что запросы приходят с одного IP-диапазона, но обратный DNS у него пустой или указывает на хостинг-провайдера, а не на вендора, это почти наверняка не ассистент. Такой трафик блокируется без сожалений.

Как проверить краулера ассистента. User-Agent: Первый фильтр, легко подделывается скраперами; Сверка с IP-диапазоном: Официальный список вендора, обновляется раз в месяц; Обратный и прямой DNS: Хост на домене вендора должен вернуть тот же IP
Три шага от строки в логах до подтверждения владельца бота

Кого пускать: решение по типу сайта

Универсального ответа нет. Всё упирается в то, как сайт зарабатывает. Если деньги приходят из показов рекламы и переходов, доступ краулерам ассистентов расширяет охват. Если деньги приходят из подписки на уникальный контент, бесплатная выдача этого контента в ответах ассистента работает против вас.

Тип сайтаПускать краулеры ассистентовПочему
Медиа и блоги с рекламойДаРост цитируемости в AI-ответах даёт дополнительную видимость
Интернет-магазиныДа, но следить за нагрузкойКарточки и описания попадают в ответы на запросы о товарах
SaaS с бесплатным тарифомДаАссистенты приводят пользователей на верх воронки
Сайты с платной подпискойЗависит от доли платного контентаПубличные страницы можно открыть, закрытые разделы - нет
Сайты с уникальными исследованиямиРешение за владельцемЦенность в первоисточнике, пересказ в ответе её размывает

Отдельно стоит вопрос про трафик. Даже если вы решили пускать ботов, стоит отслеживать, сколько ресурсов они потребляют. Краулер может обходить архивные страницы, которых нет в sitemap, и создавать нагрузку на базу данных. Это лечится настройками, а не полной блокировкой.

Пускать или блокировать: по типу сайта. Медиа и блоги с рекламой: Пускать: рост цитируемости даёт дополнительную видимость; Магазины и SaaS: Пускать, но следить за нагрузкой на сервер; Платная подписка: Открывать публичные разделы, закрывать платные; Уникальные исследования: Решение за владельцем: п
Решение зависит от того, как сайт зарабатывает

Что будет, если закрыть сайт от краулеров ассистентов

Ассистент перестанет брать контент с вашего сайта и в ответах начнёт ссылаться на другие источники. Для сайтов, которые монетизируются через трафик, это снижает видимость в AI-выдаче. По данным Similarweb, доля переходов из чат-ботов за 2024 год выросла в разы, и эта доля продолжает расти.

Если контент уникальный и вы продаёте подписку, блокировка часто оправдана: вы не отдаёте актив бесплатно. Если цель - охват и узнаваемость, лучше оставить доступ и следить за нагрузкой. Промежуточный вариант - открыть только те разделы, которые и так публичны, а закрыть материалы для подписчиков.

Здесь есть тонкость. Блокировка через robots.txt - это вежливая просьба, а не технический запрет. Добросовестные краулеры её соблюдают, скраперы игнорируют. Если нужен жёсткий контроль, robots.txt дополняется блокировкой по IP на уровне сервера или WAF.

Как ограничить нагрузку от краулеров

Интенсивность обхода зависит от размера сайта. Типичный GPTBot обходит от нескольких сотен до десятков тысяч страниц в сутки. Жёсткого лимита вендоры не публикуют, поэтому ограничения ставит владелец сайта.

В robots.txt можно задать Crawl-delay - паузу между запросами. Не все боты его уважают, но большинство крупных вендоров учитывает. На уровне сервера лимит ставится по IP или User-Agent: в Nginx это делается через limit_req_zone, на Cloudflare - через правила WAF. Если бот игнорирует лимиты и продолжает долбить сайт, блокируйте диапазон целиком.

Полезно логировать обходы отдельно от обычного трафика. Тогда видно, сколько страниц в сутки забирает каждый бот и растёт ли эта цифра. Часто проблема не в самом краулере, а в том, что он находит тысячи параметризованных URL через фильтры и пагинацию. Закрытие таких URL в robots.txt снижает нагрузку сильнее, чем общий rate limit.

Настройка доступа - часть более широкой работы с видимостью. Если вы ведёте несколько проектов и хотите передать техническую часть подрядчику, посмотрите рекламные операции для агентств.

Где взять официальные списки IP и как их поддерживать

Каждый вендор публикует диапазоны на своём сайте. OpenAI держит файл на platform.openai.com в разделе документации по ботам. Anthropic публикует список на support.anthropic.com. Google описывает диапазоны в справке по Googlebot и Google-Extended.

Списки обновляются, поэтому раз в месяц их стоит перепроверять. Вручную это быстро надоедает, и появляется соблазн забить. Практичнее подтягивать диапазоны скриптом: скачивать файл, парсить и обновлять правила на сервере или в WAF. Тогда проверка не зависит от того, вспомнил ли кто-то зайти на сайт вендора.

Если бот приходит с IP, которого нет в официальном списке, причин две. Либо это подделка: скрапер маскируется под GPTBot. Либо вендор расширил инфраструктуру и не обновил публичный список. Различить помогает обратный DNS: у настоящего GPTBot хост заканчивается на openai.com, у подделки - нет. Если обратный DNS не совпадает с прямым, запрос почти наверняка не от вендора.

Как связать доступ краулеров с аналитикой

Открытый доступ к контенту для ассистентов меняет картину трафика, и это стоит учитывать при разборе статистики. Переходы из чат-ботов часто попадают в категорию «прямые» или «переходы по ссылкам», а не в органику. Из-за этого цифры в отчётах не сходятся с ожиданиями, и полезно понимать, почему цифры в статистике разные - окно атрибуции.

Если вы отслеживаете конверсии из AI-трафика, настройте передачу событий корректно, чтобы не задваивать заявки: серверная передача конверсий без двойного счёта. А чтобы решения по ставкам и бюджетам опирались на достаточный объём данных, а не на шум, пригодится материал о том, когда данных достаточно, чтобы отключить объявление.

Отдельная задача - понять, что именно ассистенты рассказывают о вашей компании. Это проверяется не в логах, а запросами к самим ассистентам: что о компании говорят ответы ИИ - проверка репутации. И если вы хотите управлять тем, что боты видят в первую очередь, стоит завести служебный файл: llms.txt: зачем сайту этот файл и что в него писать.

Следующий шаг

Проверьте текущие логи за последние сутки и выпишите всех ботов, которые заходили на сайт. Для каждого определите, подтверждается ли он обратным DNS и попадает ли его IP в официальный список вендора. После этого примите решение по каждому: пускать, ограничивать или блокировать. Начать удобно с настройки отдельного лога для ботов, чтобы дальше работать с фактами, а не с догадками.

FAQ

Как отличить краулер AI-ассистента от обычного поискового бота?

Смотрите на User-Agent и на IP, с которых приходит запрос. Поисковые боты вроде Googlebot и YandexBot ходят с подтверждённых диапазонов, которые проверяются обратным DNS-запросом. Краулеры ассистентов (GPTBot, ClaudeBot, PerplexityBot) часто маскируются под обычные браузеры, поэтому одного User-Agent недостаточно. Сверяйте IP с опубликованными списками владельца бота.

Где посмотреть официальный список IP-адресов краулеров OpenAI, Anthropic и Google?

Каждый вендор публикует диапазоны на своём сайте. OpenAI держит файл на platform.openai.com в разделе документации по ботам, Anthropic - на support.anthropic.com, Google - в справке по Google-Extended и Googlebot. Списки обновляются, поэтому раз в месяц их стоит перепроверять. Автоматически подтягивать диапазоны удобнее через скрипт, чем вручную.

Что будет, если закрыть сайт от краулеров ассистентов через robots.txt?

Ассистент перестанет брать контент из вашего сайта и в ответах начнёт ссылаться на другие источники. Для сайтов с монетизацией через трафик это снижает видимость в AI-выдаче, которая растёт: по данным Similarweb, доля переходов из чат-ботов за 2024 год выросла в разы. Если контент уникальный и вы продаёте подписку, блокировка часто оправдана. Если цель - охват, лучше оставить доступ и следить за нагрузкой.

Сколько запросов в сутки может присылать краулер ассистента и как это ограничить?

Интенсивность зависит от размера сайта: типичный GPTBot обходит от нескольких сотен до десятков тысяч страниц в сутки. Жёсткого лимита вендоры не публикуют, но в robots.txt можно задать Crawl-delay, а на уровне сервера - rate limit по IP или User-Agent. На Nginx это делается через limit_req_zone, на Cloudflare - через правила WAF. Если бот игнорирует лимиты, блокируйте диапазон целиком.

Почему краулер ассистента может прийти с IP, которого нет в официальном списке?

Причины две: либо это подделка (скрапер маскируется под GPTBot), либо вендор расширил инфраструктуру и не обновил публичный список. Проверка через обратный DNS решает вопрос: у настоящего GPTBot хост заканчивается на openai.com, у подделки - нет. Если обратный DNS не совпадает с прямым, запрос почти наверняка не от вендора.

Посмотреть, как это устроено в ADS Beast: краулеры ассистентов.