1. Главная
  2. Блог
  3. Чат-боты и ИИ-ассистенты для бизнеса
  4. «Обучение» чат-бота на своих данных: что это на самом деле

«Обучение» чат-бота на своих данных: что это на самом деле

12 августа 2026
21

Фраза «обучим бота на ваших данных» встречается почти в каждом коммерческом предложении. В подавляющем большинстве случаев она означает не то, что понимает заказчик.

Заказчик слышит: модель изучит наши документы и будет их знать. Подрядчик имеет в виду: документы будут находиться поиском и передаваться модели в момент вопроса. Это принципиально разные вещи, и разница определяет и стоимость, и то, как бот себя ведёт при изменении документов.

Практически всегда правильный вариант — второй. И это не упрощение, а осознанный выбор: у первого есть недостатки, которые для задачи «отвечать по документам» перевешивают всё.

Три способа передать знания

1. Через промпт

Сведения кладутся прямо в инструкцию модели. Работает для небольшого объёма: правила общения, тон, несколько ключевых фактов.

Ограничение — размер. Регламент на сто страниц в инструкцию не поместится, а если поместится, то расход на каждое обращение вырастет соответственно.

2. Через поиск по базе знаний

Документы хранятся отдельно. При каждом вопросе находятся подходящие фрагменты и передаются модели вместе с вопросом. Модель отвечает по ним.

Это и есть то, что почти всегда подразумевают под «обучением на своих данных». Устройство разобрано в статье «Чат-бот по базе знаний».

3. Дообучение модели

Модель действительно меняется: её параметры корректируются на ваших примерах. Требует подготовленного набора данных, вычислительных ресурсов и повторения при каждом существенном изменении.

Почему дообучение почти никогда не нужно для бота по документам

Пять причин, и первые две решают вопрос сами по себе.

Знания устаревают вместе с моделью. Изменился прайс — поменять его в дообученной модели нельзя, нужно дообучать заново. При поиске по базе знаний достаточно заменить документ, и бот отвечает по новой редакции с того же момента.

Нельзя сослаться на источник. Дообученная модель не может показать, откуда взяла ответ: знание растворено в параметрах. Для бизнес-бота это критично — проверяемость нужна и клиенту, и вам при разборе жалоб.

Дообучение не устраняет выдумывание. Распространённое заблуждение. Модель, дообученная на ваших документах, продолжает генерировать правдоподобный текст там, где сведений не хватает, — просто в вашем стиле. Механизм — «Почему нейросеть выдумывает».

Нужен набор данных, которого у вас нет. Не документы, а пары «вопрос — правильный ответ», сотни или тысячи, единообразно оформленные. Их составление — отдельная дорогая работа.

Нельзя разграничить доступ. Дообученная модель знает всё, чему её учили, для всех. Разделить, чтобы одни сотрудники видели одно, а другие другое, невозможно — знание неотделимо от модели. Для внутреннего ассистента это закрывает вариант: «ИИ-ассистент для сотрудников».

Сравнение

Промпт Поиск по базе знаний Дообучение
Объём сведений небольшой практически любой зависит от набора данных
Обновление правка текста замена документа повторное дообучение
Ссылка на источник есть есть нет
Разграничение доступа нет есть нет
Стоимость входа минимальная средняя высокая
Расход на обращение растёт с размером инструкции средний ниже прочих
Что даёт хорошо правила, тон, формат фактические знания стиль, формат, узкая специфика

Последняя строка — ключ к пониманию, для чего дообучение действительно годится.

Когда дообучение оправдано

Устойчивый стиль или формат. Нужно, чтобы ответы всегда были в определённой манере, которую трудно описать инструкцией. Дообучение передаёт стиль лучше, чем описание стиля.

Узкая терминология. Специфический профессиональный язык, который модель систематически понимает неверно.

Строгий формат вывода. Когда ответ должен быть структурой определённого вида, и требование в промпте соблюдается не всегда.

Сокращение расходов на объёме. Дообученная модель меньшего размера может решать узкую задачу дешевле, чем крупная с длинной инструкцией. Оправдано на больших потоках — эффект считается, а не предполагается.

Общий признак: дообучение уместно для того, как отвечать, и почти никогда — для того, что отвечать. Фактические знания передаются поиском.

Технически при этом обычно используется не полное дообучение, а его облегчённые варианты — меняется небольшая часть параметров, что резко снижает стоимость. Разбор — в материалах по моделям и инфраструктуре.

Разбор ситуации: «нам нужно дообучить модель на нашей документации»

Запрос. Производственная компания. Формулировка: «У нас 2 000 страниц технической документации, хотим дообучить модель, чтобы она это знала».

Что выяснилось при разборе.

Задача была не в объёме. Реальная потребность: инженеры искали в документации параметры оборудования, а поиск по PDF работал плохо — документы сканированные, поиск по словам их не брал.

То есть проблема была в доступности документов, а не в «знании» модели. Дообучение её бы не решило: параметры оборудования — фактические сведения, которые должны находиться и цитироваться точно, а не воспроизводиться по памяти.

Что сделали вместо дообучения.

Первое — распознали сканы с сохранением структуры таблиц. Это оказалось основной работой проекта: параметры лежали именно в таблицах, а при обычном распознавании таблица превращается в кашу из чисел, потерявших привязку к строкам и столбцам.

Второе — построили поиск с обязательным цитированием: ответ сопровождался номером страницы и точной выдержкой. Для технических параметров это требование, а не удобство — инженер должен иметь возможность проверить.

Третье — добавили точный поиск по обозначениям моделей поверх смыслового. Смысловой поиск к обозначениям вида «ТМ-40/6» нечувствителен.

Где дообучение всё-таки понадобилось. В одном узком месте: модель систематически неверно интерпретировала отраслевые сокращения, читая их как общеупотребительные слова. Это исправили небольшим дообучением на нескольких сотнях примеров — задача формата «как понимать», а не «что знать».

Итог. Соотношение работ оказалось примерно таким: распознавание и подготовка документов — большая часть проекта, настройка поиска — заметная, дообучение — небольшая и вспомогательная. Ровно обратное тому, как задача выглядела в исходной формулировке.

Общий вывод. Когда просят «дообучить на наших данных», под этим почти всегда скрывается «сделать так, чтобы бот отвечал по нашим документам». Это задача подготовки материалов и поиска. Про требования к материалам — «Подготовка базы знаний для ИИ» и «Готовность данных к внедрению ИИ».

Как понять, что предлагает подрядчик

Три вопроса, снимающие двусмысленность:

  1. Что произойдёт, если мы изменим документ? «Бот начнёт отвечать по новому сразу» — это поиск. «Нужно будет переобучить» — дообучение. Первое почти всегда предпочтительнее.
  2. Сможет ли бот показать, откуда взял ответ? Может — поиск. Не может — дообучение или промпт.
  3. Что вы попросите у нас для работы? Документы — поиск. Пары «вопрос — эталонный ответ» в количестве сотен — дообучение.

Если ответы противоречивы, стоит уточнить состав работ до подписания — общий список вопросов есть в статье «10 вопросов подрядчику по внедрению ИИ».

Частые вопросы

Что значит «обучить бота на своих данных»?

В подавляющем большинстве случаев — не менять модель, а настроить поиск по вашим документам: при каждом вопросе находятся подходящие фрагменты и передаются модели. Настоящее дообучение, при котором меняются параметры модели, применяется редко и для других задач.

Чем дообучение отличается от базы знаний?

При дообучении сведения растворяются в параметрах модели: обновить их можно только повторным дообучением, а показать источник нельзя. При работе с базой знаний документы хранятся отдельно, обновляются заменой файла, и бот может сослаться на источник. Для фактических знаний второй способ надёжнее.

Нужно ли дообучать модель для чат-бота?

Для бота, отвечающего по документам, — почти никогда. Дообучение уместно, когда нужно закрепить стиль, формат ответа или специфическую терминологию, то есть повлиять на то, как бот отвечает, а не на то, что он знает.

Уберёт ли дообучение выдумывание?

Нет. Модель, дообученная на ваших данных, продолжит генерировать правдоподобный текст там, где сведений не хватает, — просто в вашей стилистике. Выдумывание устраняется другим: возможностью отказаться от ответа при отсутствии подходящих сведений и обязательным цитированием источника.

Сколько данных нужно для дообучения?

Не документы, а пары «вопрос — правильный ответ», обычно сотни или тысячи, единообразно оформленные. Их подготовка — самостоятельная работа, часто более дорогая, чем сама процедура дообучения. Это одна из причин, по которым для задачи «отвечать по документам» выбирают поиск.

Учится ли бот на диалогах с клиентами сам?

Сам — нет. Диалоги накапливаются и служат материалом для улучшения: по ним видно, чего не хватает в базе знаний и где бот ошибается. Но превращение этого в улучшение делают люди — дописывают документы, правят настройки. Автоматического самообучения в промышленных ботах не бывает, и это к лучшему: неконтролируемое изменение поведения — риск, а не преимущество.

Что дальше

Начинать надо с материалов: «Подготовка базы знаний для ИИ». Как устроен бот, отвечающий по документам, — «Чат-бот по базе знаний». Если бот уже отвечает неверно — «Чат-бот отвечает неправильно».

Определить, что действительно нужно вашей задаче — поиск по документам, промпт или дообучение, — можно до начала работ: это часть внедрения ИИ и направления чат-ботов и ассистентов.