Краулеры ИИ-систем — роботы компаний, собирающие контент для обучения моделей и работы генеративных сервисов: GPTBot и OAI-SearchBot у OpenAI, ClaudeBot у Anthropic, PerplexityBot и другие. Практическая роль: это отдельный от обычного поиска обход сайта — видимый в логах и управляемый через robots.txt.
Кто ходит по сайту кроме Googlebot
Краулеры делятся на две категории — и политика к ним разная. Первая обслуживает обучение моделей: GPTBot (OpenAI), ClaudeBot (Anthropic), Google-Extended (данные для Gemini), Bytespider (ByteDance), meta-externalagent (Meta), Applebot-Extended (Apple), CCBot (открытый корпус Common Crawl, из которого собирают обучающие датасеты многие лаборатории). Вторая обслуживает генеративные продукты — поиск с ИИ-ответами, о формате которого написано в статье «Генеративный поиск и ИИ-обзоры»: OAI-SearchBot и ChatGPT-User у OpenAI, Claude-SearchBot, PerplexityBot.
Нюанс про Google и Bing. Ответы AI Overviews и Copilot собирают те же Googlebot и Bingbot, что и обычную выдачу: отдельного разрешения для попадания в эти обзоры не существует, работает стандартная индексация. Специальные токены нужны только для обучения и отдельных продуктов.
Объёмы пока скромные. Суммарный обход ИИ-краулеров на типовом контентном сайте обычно на порядок меньше Googlebot, но растёт от квартала к кварталу; это измеримо логами, а не ощущениями.
Как идентифицировать краулер и проверить его по логам
User-agent — только первый фильтр. Строку агента подделать тривиально, поэтому сомнительные адреса проверяют обратным DNS: адрес переводится в имя хоста, имя — обратно в адрес; у настоящих роботов крупных компаний имена лежат в их доменах. OpenAI, Anthropic и Perplexity публикуют актуальные диапазоны IP в документации, Common Crawl — свои.
Что смотреть в логах. За месяц сгруппируйте запросы по user-agent и оцените три вещи: долю ИИ-краулеров в обходе, какие разделы они запрашивают, какие коды получают. Доля ниже 1% запросов — вопрос академический; 5–10% с ростом — уже решения о нагрузке и доступе. Коды 403 и 429 означают, что бот-защита их режет, возможно без вашего ведома.
Проверьте CDN. Режимы «борьбы с ботами» отдают краулерам challenge-страницу, которую те решить не могут: сайт тихо выпадает из источников без единой ошибки в интерфейсе. После изменения бот-политики сверяйтесь с логами, а не с галочками в панели.
Разрешить или запретить: разбор компромисса
Аргументы за «разрешить». Продуктовым краулерам нужно отдать контент, чтобы генеративные системы могли брать вас в ответы; запрет исключает сайт из нового канала, а конкуренты там остаются. Присутствие в ответах конвертируется в брендовый поиск и переходы — это аргумент бизнеса, а не альтруизм.
Аргументы за «запретить». Обучение моделей на вашем контенте не оплачено и не согласовано; если прямой отдачи от модели нет, разрешение тренировочным краулерам — пополнение чужой базы знаний бесплатно, плюс нагрузка на сервер без встречного потока.
Универсального ответа нет. Подписные издания чаще закрывают тренировочных роботов и ограничивают агрегаторов; интернет-магазины и B2B-блоги чаще разрешают всё — присутствие в ответах для них дороже принципов. Решение зависит от того, как контент приносит деньги, а не от «лучшей практики» из общих статей.
Механика robots.txt. Директивы группируются по токену: строка User-agent с именем агента и следом Allow или Disallow с путями; агенты, не названные отдельно, попадают под общий блок со звёздочкой. Файл кэшируется — эффект обычно наступает в пределах суток-двух. Страницы, уже попавшие в индексы и датасеты, при запрете из прошлого не исчезают.
Частичная политика
Рабочая схема — разрешать по категориям. Продуктовым агентам (OAI-SearchBot, PerplexityBot, обычные Googlebot и Bingbot) — разрешить: они приносят видимость в ответах. Тренировочным (GPTBot, ClaudeBot, Google-Extended, CCBot, Bytespider) — по решению бизнеса: запрет экономит контент и нагрузку, разрешение повышает шанс, что будущая модель узнает о вас из первоисточника, а не из чужих обзоров.
Common Crawl — отдельный случай. Запрет CCBot не гарантирует отсутствия в обучающих данных: корпус переиспользуют с лагом в месяцы и годы, и контент мог попасть туда через зеркала и агрегаторы. Управлять файлом можно, управлять датасетами на его основе — нет.
Границы robots.txt. Это соглашение, а не барьер: крупные компании его соблюдают, и это задокументировано, но известны и обходы — получение контента через сторонние прокси, и краулеры, игнорирующие запрет (Bytespider блокировали CDN-провайдеры именно за это). Принципиальные запреты дублируйте серверно: код 403 по проверенным диапазонам IP.
Дополнение — навигация. Доступ и понятность — разные задачи: помимо роботса существует предлагаемый файл llms.txt, карта важного для ИИ-систем.
Где уместно и когда нужно
Решение материально, когда контент — актив. Блог приводит лиды, медиа продаёт охваты, каталог живёт на органике — тогда политика по краулерам входит в контур управления каналом и заслуживает ревизии раз в квартал.
Закрытые системы — не про роботс. Кабинеты, внутренние порталы и авторизованный контент защищает аутентификация: добравшийся до формы логина краулер ничего не получит и без запретов. robots.txt — инструмент для публичной части сайта.
Типичные ошибки
- Запретить всё одним блоком. Общий блок со звёздочкой, закрытый из-за одного надоедливого робота, выпускает и полезных агентов, а иногда и сам поиск; перечисляйте токены явно.
- Путать Google-Extended и Googlebot. Первый управляет только использованием данных для обучения Gemini и не влияет на индексацию и AI Overviews; запрещая его, поиск не закрывают.
- Считать robots.txt защитой. Это просьба, а не замок; защита контента — серверная: коды ответов, диапазоны IP, ограничение частоты запросов.
- Не проверять эффект изменений. Сменили политику — через одну-две недели сверьте логи: приходят ли разрешённые агенты, ушли ли запрещённые.
- Решать по обзорам, а не по своим логам. Состав и активность краулеров меняются быстрее публикаций; ваш сайт виден вам лучше, чем авторам общих материалов.
Частые вопросы
Уважают ли ИИ-краулеры robots.txt?
Крупные — да, механика описана в их документации. Но это конвенция: известны и роботы, игнорирующие запрет, и случаи получения контента через сторонние сервисы — критичные закрытия дублируйте блокировкой на уровне CDN или файрвола.
Разрешение GPTBot увеличит трафик?
Нет: GPTBot — тренировочный краулер, переходов он не приносит. Видимость в ответах дают продуктовые агенты — OAI-SearchBot, PerplexityBot и обычные Googlebot с Bingbot.
Можно ли пустить краулеры только в часть сайта?
Да, директивами с путями: разрешить блог и карточки, закрыть поиск по сайту, страницы параметров фильтров и служебные разделы — стандартный баланс видимости и нагрузки.
Что делать, если краулер игнорирует запрет?
Зафиксировать в логах, сверить адрес с опубликованными диапазонами, отдавать 403 на уровне CDN или файрвола; систематическое массовое игнорирование — вопрос юристов, а не роботса.
Как часто пересматривать политику?
Раз в квартал и после событий: смена бизнес-модели контента, заметный referral-трафик от ИИ-сервисов, инциденты обхода. Между ревизиями достаточно ежемесячного просмотра логов.
Видно ли в логах, кто именно ходил?
Да, если логируется user-agent; сомнительные адреса верифицируйте обратным DNS и опубликованными диапазонами — одного имени агента мало.