1. Главная
  2. Блог
  3. GEO и AI-поиск
  4. Краулеры AI-систем: кто ходит по сайту и стоит ли их пускать

Краулеры AI-систем: кто ходит по сайту и стоит ли их пускать

15 августа 2026
21

По вашему сайту ходят не только поисковые роботы. За последние годы появился отдельный класс краулеров — боты ИИ-компаний, и они решают разные задачи.

Различие между этими задачами — главное, что нужно понять перед тем, как принимать решение о доступе:

Одни боты собирают тексты для обучения моделей. Другие ходят по сайту в момент, когда пользователь задал вопрос, чтобы дать ответ со ссылкой на вас.

Закрыть доступ первым и вторым — разные решения с разными последствиями. Их часто закрывают вместе одним движением, и это ошибка.

Как технически закрыть доступ, разобрано отдельно — «Как запретить доступ к сайту боту ChatGPT». Здесь — кто есть кто и стоит ли.

Три типа ботов

Сбор для обучения

Собирают тексты, которые попадут в обучающие данные будущих моделей.

Что вы получаете: практически ничего напрямую. Ваш контент становится частью того, что модель «знает», но без ссылки и без перехода.

Что теряете при закрытии: мало. Разве что упоминание вашей темы в будущих моделях, но проследить это невозможно.

Типичные представители: боты, помеченные производителями как относящиеся к сбору обучающих данных. Названия меняются, и списки стоит смотреть в актуальных источниках самих компаний.

Обход для ответа пользователю

Ходят по сайту в момент запроса или используют свежий индекс, чтобы ответить и сослаться на источник.

Что вы получаете: присутствие в ответе, ссылку, переходы от тех, кому нужны подробности.

Что теряете при закрытии: видимость в ИИ-ответах. Это прямая потеря.

Классические поисковые роботы

Обходят для обычной выдачи. Их закрывать никто не собирается, но стоит помнить: у ряда компаний обучающий бот и поисковый — разные, и закрывать надо адресно. Неаккуратная директива может задеть поисковую индексацию.

Что вы теряете и что получаете

Решение Приобретаете Теряете
Закрыть всё контент не уходит в обучение присутствие в ИИ-ответах
Закрыть только обучающие контент не уходит в обучение почти ничего
Открыть всё максимум присутствия контент используется для обучения
Закрыть частично, по разделам контроль сложнее в сопровождении

Вариант во второй строке — тот, который выбирают чаще всего осознанно. Он даёт присутствие в ответах и снимает основную часть возражения про использование контента.

Как решать

Вопрос не технический, а деловой. Три соображения.

Что для вас контент

Если контент — инструмент привлечения (блог, справочник, экспертные материалы), присутствие в ИИ-ответах ценнее опасений по поводу обучения. Закрывать боты, дающие ссылку, — значит отказываться от канала.

Если контент — сам продукт (платные материалы, база, за доступ к которой платят), логика обратная.

Есть ли ограничения на использование

Юридическая сторона: условия использования вашего сайта, права на материалы, наличие лицензионных ограничений. Это к юристу.

Отдельно: с 2027 года вступают в силу положения российского закона об ИИ, касающиеся работы с объектами авторского права при обучении — «243-ФЗ для бизнеса».

Что вы теряете в трафике

Если ваши запросы информационные и по ним появляются генеративные ответы, закрытие доступа означает исчезновение из них. При этом трафик, который забирает генеративный ответ, вы теряете в любом случае — но без ссылки на вас.

Формулировка, которая помогает решить: ответ пользователю всё равно будет дан. Вопрос в том, будете ли вы в нём указаны как источник.

Технические способы управления доступом

robots.txt — основной инструмент. Директивы для конкретных ботов по их идентификаторам. Работает на добровольной основе: добросовестные боты соблюдают, недобросовестные — нет.

Ограничение на уровне сервера — по идентификатору бота или по сети. Надёжнее, но требует поддержки и может задеть лишнее.

Разные правила для разных разделов — открыть блог, закрыть закрытую часть. Требует аккуратности в сопровождении.

Метатеги на уровне страницы — часть систем поддерживает указания о запрете использования содержимого. Поддержка неравномерная.

Про llms.txt. Периодически предлагается как отдельный файл с описанием сайта для ИИ-систем. Это предложение, а не стандарт: широкой поддержки со стороны крупных систем на сегодня нет. Заводить его можно, вреда не будет, но рассчитывать на эффект пока не стоит.

Как посмотреть, кто к вам ходит

Практическая часть, которую редко делают.

Логи сервера — единственный достоверный источник. В них видно, какие боты обходят сайт, как часто и какие страницы.

Что смотреть:

  • какие боты присутствуют и в каком объёме;
  • сколько запросов они делают — иногда это заметная нагрузка;
  • какие разделы обходят;
  • соблюдают ли ваши текущие правила.

Побочная находка, которая встречается часто: боты ИИ-компаний могут создавать существенную долю нагрузки на сайт. Если хостинг ограничен, это отдельная причина для управления доступом — не идеологическая, а вполне практическая.

Чего делать не стоит

Закрывать всё одним движением «чтобы контент не воровали». Вы закроете и тех, кто даёт ссылки.

Копировать чужой robots.txt. Списки ботов меняются, и чужой файл может содержать устаревшие или неверные директивы.

Использовать неточные маски, которые задевают поисковых роботов. Проверяйте, что вы закрываете именно то, что хотели.

Считать robots.txt защитой. Это соглашение, а не запрет: недобросовестный бот его проигнорирует.

Принимать решение раз и навсегда. Состав ботов и их поведение меняются, файл стоит пересматривать.

Частые вопросы

Какие боты ИИ-систем обходят сайты?

Три типа: собирающие тексты для обучения моделей, обходящие сайт для ответа пользователю со ссылкой на источник и обычные поисковые роботы. Первые два часто закрывают одним движением, хотя последствия у этого разные.

Стоит ли закрывать доступ ИИ-краулерам?

Зависит от того, чем для вас является контент. Если он привлекает клиентов, присутствие в ИИ-ответах ценнее опасений по поводу обучения, и закрывать стоит только обучающие боты. Если контент сам является продуктом, логика обратная.

Что я потеряю, если закрою всё?

Присутствие в генеративных ответах со ссылкой на вас. При этом ответ пользователю всё равно будет дан — из других источников. То есть трафик по этому запросу вы теряете в любом случае, вопрос лишь в том, будете ли указаны как источник.

Как узнать, кто ходит по моему сайту?

По логам сервера — это единственный достоверный источник. В них видно, какие боты присутствуют, как часто обходят и какие разделы. Попутно нередко выясняется, что они создают заметную долю нагрузки.

Работает ли robots.txt против ИИ-ботов?

Для добросовестных — да, они его соблюдают. Это соглашение, а не техническая защита: бот, который не хочет его соблюдать, не обязан. Для надёжного ограничения нужны меры на уровне сервера.

Что такое llms.txt и нужен ли он?

Предложенный формат файла с описанием сайта для ИИ-систем. На сегодня это именно предложение, а не поддержанный крупными системами стандарт. Завести его можно, вреда не будет, но рассчитывать на эффект пока преждевременно.

Что дальше

Как технически закрыть доступ — «Как запретить доступ к сайту боту ChatGPT». Что боты не увидят, даже если пустить, — «JavaScript и невидимость для ИИ». Ради чего вообще пускать — «GEO и SEO: в чём разница». Правовая сторона использования контента — «Авторские права на ИИ-контент».

Разбор логов с картиной того, кто и как обходит сайт, — часть аудита и работы по SEO и GEO продвижению.