1. Главная
  2. Блог
  3. Чат-боты и ИИ-ассистенты для бизнеса
  4. Метрики чат-бота: что измерять и как считать

Метрики чат-бота: что измерять и как считать

12 августа 2026
20

Отчёты по чат-ботам обычно состоят из показателей, которые легко считать и невозможно интерпретировать: число диалогов, количество сообщений, «удовлетворённость». Ни один из них не отвечает на вопрос, ради которого бот делался.

Причина в том, что метрики выбирают по доступности, а не по смыслу. Правильный порядок обратный: сначала формулируется, какую задачу бот решает, потом подбирается показатель, который её отражает.

И отдельно — есть метрики, которые нельзя улучшать напрямую. Их улучшение достигается ухудшением реальной работы, и об этом ниже.

Главная метрика

Доля обращений, закрытых ботом полностью.

Считается как: диалоги, где клиент получил ответ и не обратился к человеку и не написал повторно в течение суток, делённые на все диалоги.

Три условия в определении не декоративны:

  • получил ответ — не «бот что-то сказал»;
  • не ушёл к оператору — иначе задача не снята;
  • не написал повторно — иначе ответ не помог, а только отсрочил обращение.

Именно последнее условие чаще всего опускают, и именно оно превращает показатель из честного в приукрашенный. Клиент, которому бот ответил неверно, часто не спорит — он просто пишет менеджеру через десять минут. В отчёте без проверки повторов оба обращения засчитываются как успешные.

Реалистичные значения: 40–70% для бота по базе знаний при подготовленных материалах, выше — для узких сценарных ботов. Заявленные 90% почти всегда означают, что из знаменателя убрали переданные оператору диалоги.

Метрики качества ответов

Доля отказов. Диалоги, где бот сказал «не знаю». Не дефект, а показатель полноты базы знаний. Растёт — материалов не хватает или изменились вопросы. Падает до нуля — подозрительно: значит, бот отвечает там, где не должен.

Результат на эталонном наборе. 100–200 реальных вопросов с проверенными ответами, прогон после каждого изменения. Единственная метрика, которая измеряет качество, а не поведение пользователей. Изменение, ухудшившее результат, откатывается.

Доля ответов с источником. Для бота по базе знаний — сколько ответов сопровождаются ссылкой на документ. Ответ без источника означает, что модель ответила от себя.

Доля повторных вопросов внутри диалога. Клиент переформулировал — значит, не понял или не получил нужного. Хороший ранний признак проблем.

Метрики передачи оператору

Доля переданных диалогов. Смотреть надо на причины, а не на величину. Разбивка по поводам — попросил сам, бот не знал, стоп-тема, недовольство — показывает, что чинить.

Важно: это метрика, которую нельзя улучшать напрямую. Снижение доли передач достигается тем, что боту труднее передать диалог, а это ухудшение, а не улучшение. Разбор — «Передача диалога оператору».

Время до передачи. Сколько человек мучился, прежде чем попал к оператору. Чем меньше — тем лучше. Растущее время означает, что бот пытается отвечать там, где должен был сдаться.

Доля передач с полным контекстом. Оператор получил историю или одно последнее сообщение.

Метрики бизнеса

Ради них всё и делалось.

Снятая нагрузка в часах. Закрытые обращения × среднее время сотрудника на обращение. Условная величина до тех пор, пока не определено, во что превратилось высвобожденное время, — «Расчёт окупаемости чат-бота».

Скорость первого ответа. Единственная метрика, которая улучшается практически гарантированно.

Конверсия обращения в заявку. Сравнивается с периодом без бота или, если возможно, между группами пользователей.

Обращения вне рабочего времени. Сколько обработано ботом. Раньше терялись — теперь нет.

Расход на обращение. Стоимость модели ÷ число диалогов. Должен быть устойчивым; резкий рост означает, что что-то изменилось в поведении или в размере передаваемого контекста.

Метрики, вводящие в заблуждение

Число диалогов. Растёт от рекламы, от заметности виджета, от того, что бот стал хуже отвечать и люди пишут по два раза. О пользе не говорит ничего.

Число сообщений в диалоге. Больше — это плохо или хорошо? Может означать вовлечённость, может — что человек не может добиться ответа. Без разреза не интерпретируется.

«Удовлетворённость» по оценкам. Оценку ставят единицы, и, как правило, крайне недовольные и крайне довольные. Как показатель по всей массе не работает. Полезнее кнопка «ответ не помог» — она даёт не оценку, а адрес проблемы.

Точность в процентах без указания набора. «Бот отвечает с точностью 95%» — бессмысленно, пока не сказано, на каком наборе вопросов и кто определял правильность.

Экономия в рублях без проверки. Расчётная величина, выдаваемая за факт. Если 40 часов сэкономлено, а штат и нагрузка прежние, экономии в отчётности не будет.

Пример разбора отчёта

Условный отчёт за месяц. Показывает, почему метрики читают вместе, а не по отдельности.

Показатель Значение Изменение к прошлому месяцу
Диалогов 3 200 +18%
Закрыто ботом полностью 52% −6 п.п.
Отказов «не знаю» 11% +4 п.п.
Передано оператору 37% +2 п.п.
Повторных обращений в течение суток 9% +3 п.п.
Результат на эталонном наборе 87% без изменений
Расход на обращение 3,1 ₽ +0,4 ₽

Как это читается.

Число диалогов выросло, а доля закрытых упала. Само по себе это может значить и приток новой аудитории, и деградацию.

Ключ — эталонный набор не изменился. Значит, бот отвечает на прежние вопросы так же хорошо, как раньше. Качество не упало.

Тогда откуда рост отказов и повторов? Вопросы изменились: пришли новые темы, которых нет в базе знаний. Бот честно отказывается — отсюда рост отказов, — но часть людей, получив отказ, пишут повторно, отсюда рост повторных обращений.

Рост расхода на обращение подтверждает: диалоги стали длиннее, люди переформулируют.

Вывод: ничего не сломалось, база знаний отстала от изменившихся вопросов. Действие — разобрать отказы за месяц, сгруппировать по темам, дописать материалы. Не менять модель, не переписывать промпт.

А теперь тот же отчёт с одним отличием: эталонный набор упал с 87% до 74%. Вывод обратный — сломалось качество, и разбираться надо по цепочке: «Чат-бот отвечает неправильно».

Практическое правило: эталонный набор отделяет «изменились вопросы» от «испортился бот». Без него эти два случая выглядят одинаково, а лечатся противоположно.

Что настроить до запуска

Метрики, не заложенные заранее, потом не восстанавливаются.

  • Журнал диалогов с записью найденных фрагментов и источников ответа.
  • Метка закрытия: ушёл к оператору, написал повторно, ничего.
  • Причина передачи в структурированном виде, а не текстом.
  • Кнопка «ответ не помог» в интерфейсе.
  • Эталонный набор из реальных вопросов — составляется до запуска, иначе будет составлен под уже существующее поведение бота.
  • Период сравнения: показатели поддержки за месяц до запуска. Без них не с чем сравнивать.

Последний пункт пропускают чаще всего, и восстановить его задним числом нельзя.

Частые вопросы

Какая главная метрика чат-бота?

Доля обращений, закрытых ботом полностью: клиент получил ответ, не ушёл к оператору и не написал повторно в течение суток. Условие про повторное обращение существенно: без него в успешные попадают диалоги, где бот ответил неверно, а человек молча пошёл к менеджеру.

Какая доля закрытых обращений считается нормальной?

Для бота по базе знаний при подготовленных материалах — 40–70% в зависимости от однородности вопросов. У узких сценарных ботов бывает выше. Значения около 90% почти всегда означают, что из расчёта убрали диалоги, ушедшие к оператору.

Плохо ли, что бот часто отвечает «не знаю»?

Само по себе — нет: честный отказ лучше уверенного неверного ответа. Доля отказов — это показатель полноты базы знаний, и её рост означает, что материалов не хватает или изменились вопросы. Настораживать должно обратное: отказов ноль, значит бот отвечает и там, где данных нет.

Как понять, что бот стал хуже?

По результату на эталонном наборе из реальных вопросов с проверенными ответами. Только он отделяет ухудшение бота от изменения вопросов: если набор не просел, а доля закрытых упала — изменились вопросы, и нужно дописать материалы, а не чинить бота.

Считать ли удовлетворённость по оценкам?

Как основной показатель — нет: оценку ставят единицы, обычно с краёв шкалы. Полезнее кнопка «ответ не помог»: она даёт не оценку, а конкретный диалог, который можно разобрать.

Что нужно настроить до запуска?

Журнал диалогов с записью найденных фрагментов, отметку о том, чем закончился диалог, причины передачи оператору, кнопку «ответ не помог» и эталонный набор вопросов. Отдельно — снять показатели поддержки за месяц до запуска: без них не с чем будет сравнивать.

Что дальше

Как считать эффект в деньгах — «Расчёт окупаемости чат-бота». Как отделить вклад бота от прочих изменений — «Как измерить эффект от внедрения ИИ». Если показатели ухудшились — «Чат-бот отвечает неправильно».

Настройка измерений и регулярный разбор показателей входят в сопровождение решений по чат-ботам и ассистентам.