Отчёты по чат-ботам обычно состоят из показателей, которые легко считать и невозможно интерпретировать: число диалогов, количество сообщений, «удовлетворённость». Ни один из них не отвечает на вопрос, ради которого бот делался.
Причина в том, что метрики выбирают по доступности, а не по смыслу. Правильный порядок обратный: сначала формулируется, какую задачу бот решает, потом подбирается показатель, который её отражает.
И отдельно — есть метрики, которые нельзя улучшать напрямую. Их улучшение достигается ухудшением реальной работы, и об этом ниже.
Главная метрика
Доля обращений, закрытых ботом полностью.
Считается как: диалоги, где клиент получил ответ и не обратился к человеку и не написал повторно в течение суток, делённые на все диалоги.
Три условия в определении не декоративны:
- получил ответ — не «бот что-то сказал»;
- не ушёл к оператору — иначе задача не снята;
- не написал повторно — иначе ответ не помог, а только отсрочил обращение.
Именно последнее условие чаще всего опускают, и именно оно превращает показатель из честного в приукрашенный. Клиент, которому бот ответил неверно, часто не спорит — он просто пишет менеджеру через десять минут. В отчёте без проверки повторов оба обращения засчитываются как успешные.
Реалистичные значения: 40–70% для бота по базе знаний при подготовленных материалах, выше — для узких сценарных ботов. Заявленные 90% почти всегда означают, что из знаменателя убрали переданные оператору диалоги.
Метрики качества ответов
Доля отказов. Диалоги, где бот сказал «не знаю». Не дефект, а показатель полноты базы знаний. Растёт — материалов не хватает или изменились вопросы. Падает до нуля — подозрительно: значит, бот отвечает там, где не должен.
Результат на эталонном наборе. 100–200 реальных вопросов с проверенными ответами, прогон после каждого изменения. Единственная метрика, которая измеряет качество, а не поведение пользователей. Изменение, ухудшившее результат, откатывается.
Доля ответов с источником. Для бота по базе знаний — сколько ответов сопровождаются ссылкой на документ. Ответ без источника означает, что модель ответила от себя.
Доля повторных вопросов внутри диалога. Клиент переформулировал — значит, не понял или не получил нужного. Хороший ранний признак проблем.
Метрики передачи оператору
Доля переданных диалогов. Смотреть надо на причины, а не на величину. Разбивка по поводам — попросил сам, бот не знал, стоп-тема, недовольство — показывает, что чинить.
Важно: это метрика, которую нельзя улучшать напрямую. Снижение доли передач достигается тем, что боту труднее передать диалог, а это ухудшение, а не улучшение. Разбор — «Передача диалога оператору».
Время до передачи. Сколько человек мучился, прежде чем попал к оператору. Чем меньше — тем лучше. Растущее время означает, что бот пытается отвечать там, где должен был сдаться.
Доля передач с полным контекстом. Оператор получил историю или одно последнее сообщение.
Метрики бизнеса
Ради них всё и делалось.
Снятая нагрузка в часах. Закрытые обращения × среднее время сотрудника на обращение. Условная величина до тех пор, пока не определено, во что превратилось высвобожденное время, — «Расчёт окупаемости чат-бота».
Скорость первого ответа. Единственная метрика, которая улучшается практически гарантированно.
Конверсия обращения в заявку. Сравнивается с периодом без бота или, если возможно, между группами пользователей.
Обращения вне рабочего времени. Сколько обработано ботом. Раньше терялись — теперь нет.
Расход на обращение. Стоимость модели ÷ число диалогов. Должен быть устойчивым; резкий рост означает, что что-то изменилось в поведении или в размере передаваемого контекста.
Метрики, вводящие в заблуждение
Число диалогов. Растёт от рекламы, от заметности виджета, от того, что бот стал хуже отвечать и люди пишут по два раза. О пользе не говорит ничего.
Число сообщений в диалоге. Больше — это плохо или хорошо? Может означать вовлечённость, может — что человек не может добиться ответа. Без разреза не интерпретируется.
«Удовлетворённость» по оценкам. Оценку ставят единицы, и, как правило, крайне недовольные и крайне довольные. Как показатель по всей массе не работает. Полезнее кнопка «ответ не помог» — она даёт не оценку, а адрес проблемы.
Точность в процентах без указания набора. «Бот отвечает с точностью 95%» — бессмысленно, пока не сказано, на каком наборе вопросов и кто определял правильность.
Экономия в рублях без проверки. Расчётная величина, выдаваемая за факт. Если 40 часов сэкономлено, а штат и нагрузка прежние, экономии в отчётности не будет.
Пример разбора отчёта
Условный отчёт за месяц. Показывает, почему метрики читают вместе, а не по отдельности.
| Показатель | Значение | Изменение к прошлому месяцу |
|---|---|---|
| Диалогов | 3 200 | +18% |
| Закрыто ботом полностью | 52% | −6 п.п. |
| Отказов «не знаю» | 11% | +4 п.п. |
| Передано оператору | 37% | +2 п.п. |
| Повторных обращений в течение суток | 9% | +3 п.п. |
| Результат на эталонном наборе | 87% | без изменений |
| Расход на обращение | 3,1 ₽ | +0,4 ₽ |
Как это читается.
Число диалогов выросло, а доля закрытых упала. Само по себе это может значить и приток новой аудитории, и деградацию.
Ключ — эталонный набор не изменился. Значит, бот отвечает на прежние вопросы так же хорошо, как раньше. Качество не упало.
Тогда откуда рост отказов и повторов? Вопросы изменились: пришли новые темы, которых нет в базе знаний. Бот честно отказывается — отсюда рост отказов, — но часть людей, получив отказ, пишут повторно, отсюда рост повторных обращений.
Рост расхода на обращение подтверждает: диалоги стали длиннее, люди переформулируют.
Вывод: ничего не сломалось, база знаний отстала от изменившихся вопросов. Действие — разобрать отказы за месяц, сгруппировать по темам, дописать материалы. Не менять модель, не переписывать промпт.
А теперь тот же отчёт с одним отличием: эталонный набор упал с 87% до 74%. Вывод обратный — сломалось качество, и разбираться надо по цепочке: «Чат-бот отвечает неправильно».
Практическое правило: эталонный набор отделяет «изменились вопросы» от «испортился бот». Без него эти два случая выглядят одинаково, а лечатся противоположно.
Что настроить до запуска
Метрики, не заложенные заранее, потом не восстанавливаются.
- Журнал диалогов с записью найденных фрагментов и источников ответа.
- Метка закрытия: ушёл к оператору, написал повторно, ничего.
- Причина передачи в структурированном виде, а не текстом.
- Кнопка «ответ не помог» в интерфейсе.
- Эталонный набор из реальных вопросов — составляется до запуска, иначе будет составлен под уже существующее поведение бота.
- Период сравнения: показатели поддержки за месяц до запуска. Без них не с чем сравнивать.
Последний пункт пропускают чаще всего, и восстановить его задним числом нельзя.
Частые вопросы
Какая главная метрика чат-бота?
Доля обращений, закрытых ботом полностью: клиент получил ответ, не ушёл к оператору и не написал повторно в течение суток. Условие про повторное обращение существенно: без него в успешные попадают диалоги, где бот ответил неверно, а человек молча пошёл к менеджеру.
Какая доля закрытых обращений считается нормальной?
Для бота по базе знаний при подготовленных материалах — 40–70% в зависимости от однородности вопросов. У узких сценарных ботов бывает выше. Значения около 90% почти всегда означают, что из расчёта убрали диалоги, ушедшие к оператору.
Плохо ли, что бот часто отвечает «не знаю»?
Само по себе — нет: честный отказ лучше уверенного неверного ответа. Доля отказов — это показатель полноты базы знаний, и её рост означает, что материалов не хватает или изменились вопросы. Настораживать должно обратное: отказов ноль, значит бот отвечает и там, где данных нет.
Как понять, что бот стал хуже?
По результату на эталонном наборе из реальных вопросов с проверенными ответами. Только он отделяет ухудшение бота от изменения вопросов: если набор не просел, а доля закрытых упала — изменились вопросы, и нужно дописать материалы, а не чинить бота.
Считать ли удовлетворённость по оценкам?
Как основной показатель — нет: оценку ставят единицы, обычно с краёв шкалы. Полезнее кнопка «ответ не помог»: она даёт не оценку, а конкретный диалог, который можно разобрать.
Что нужно настроить до запуска?
Журнал диалогов с записью найденных фрагментов, отметку о том, чем закончился диалог, причины передачи оператору, кнопку «ответ не помог» и эталонный набор вопросов. Отдельно — снять показатели поддержки за месяц до запуска: без них не с чем будет сравнивать.
Что дальше
Как считать эффект в деньгах — «Расчёт окупаемости чат-бота». Как отделить вклад бота от прочих изменений — «Как измерить эффект от внедрения ИИ». Если показатели ухудшились — «Чат-бот отвечает неправильно».
Настройка измерений и регулярный разбор показателей входят в сопровождение решений по чат-ботам и ассистентам.