1. Главная
  2. Docs
  3. Глоссарий
  4. Оценка моделью-судьёй

Оценка моделью-судьёй

7

Оценка моделью-судьёй (LLM-as-judge) — автоматическая оценка ответов языковой моделью по заданным критериям: релевантность вопросу, опора на источники, полнота. Даёт масштабируемую обратную связь на каждую итерацию, но систематически смещена, поэтому калибруется по ручной разметке и не заменяет её в ответственных решениях.

Что это и зачем

Экономика метода. Ручная разметка ответа экспертом — две-пять минут на оценку по критерию; судья — секунды и доли цента за прогон. Разница превращает оценку из события — «раз в квартал вручную проверим выборку» — в рутину: каждая версия, каждый кандидат, каждое обновление промпта.

Основной сценарий — сравнение версий. Судья устойчиво различает «стало лучше или хуже» между конфигурациями на одном наборе, и для этого он пригоден. Абсолютные значения его оценок — условные баллы; «качество системы 8,2 из 10» из них не следует.

Судья — часть бенчмарка, а не истина. Промпт судьи, его модель, температура и формат шкалы фиксируются вместе с проверочным набором; смена любого элемента меняет шкалу и обнуляет сравнение с прошлыми прогонами. Об устройстве самого набора — статья про проверочный набор и бенчмарк.

Систематические перекосы

Длинные ответы оцениваются выше. Самый известный перекос: при прочих равных судья предпочитает развёрнутый ответ краткому, даже если в развёрнутом те же факты плюс вода. Механизм: длинный текст даёт больше поводов найти «что-то полезное». Лечение — критерии с явным штрафом за нерелевантные добавления и требованием цитат по каждому утверждению.

Самопредпочтение. Судьи выше оценивают ответы моделей собственного семейства: совпадение стиля и формулировок воспринимается как качество. Для сравнения двух версий одной модели это менее критично, чем для сравнения разных моделей; при выборе моделей судьёй берут из другого семейства.

Чувствительность к формату. Маркированные списки, заголовки и уверенный тон систематически добавляют баллы; ответ с теми же фактами сплошным текстом оценивается ниже. Если сравниваемые версии различаются форматом, эффект смешивается с качеством — фиксируйте единый формат выдачи или требуйте от судьи оценивать только содержание.

Доверие самоуверенности. Судья плохо отличает обоснованную уверенность от стильной: категоричный тон без опоры на источник проходит выше осторожного ответа с оговорками. Против этого — критерий «каждое утверждение подтверждено цитатой из фрагмента», родственный faithfulness.

Слепота за пределами контекста. Судья видит вопрос, ответ и, возможно, фрагменты; фактическую ошибку вне этого поля он не заметит и не проверит. Проверку фактов против внешних источников судья не заменяет.

Позиционные эффекты и как они снимаются

В парном сравнении побеждает позиция. При показе двух ответов исход зависит от порядка: обычно смещение в пользу первого — он формирует ожидание, второй сравнивается с уже принятой рамкой. Иллюстративно: до 10–20% пар меняют исход при перестановке — на фоне разницы версий в несколько пунктов это много.

Снятие — прогон в обоих порядках. Каждую пару оценивают дважды: «A против B» и «B против A»; итог считают по согласованным решениям, противоречивые пары — ничья или передача человеку. Стоит вдвое дороже и убирает большую часть эффекта.

Одиночная оценка свободна от позиционности, но беднее. Оценка ответа по шкале без пары не зависит от порядка, но опирается на внутренний эталон судьи, который плывёт между прогонами; для тонких различий парная схема чувствительнее.

Судья стохастичен. При ненулевой температуре повторный прогон меняет оценки; для метрик судью запускают с температурой 0, а близкие результаты — разница в один-два балла из десяти — перепроверяют повторами или трактуют как совпадение.

Калибровка по ручной разметке

Калибровка — проверка судьи людьми. Двадцать-пятьдесят типичных ответов оценивают дважды: эксперты и судья; затем считают согласие — долю совпадающих решений или корреляцию баллов. Это разовая работа на несколько часов, повторяемая при смене промпта судьи, его модели или формата задачи.

Порог согласия. Рабочие ориентиры (иллюстративные): согласие 70–85% — судья пригоден для сравнения версий; ниже 60–70% — сначала чинить промпт судьи: уточнить критерии, добавить требование цитат, ввести промежуточные градации шкалы. Порог задаётся под цену решения, а не берётся из таблицы.

Анализ расхождений полезнее среднего. Важнее доли согласия — где именно судья ошибается: завышает длинным ответам, занижает отказам. Правильный отказ — «не нашлось» там, где ответа нет, — судьи часто штрафуют как неуверенность; система в ответ начинает маскировать отказы уверенной болтовнёй. Отказы выносят в отдельный критерий и калибруют отдельно.

Эталон калибровки — согласие людей, а не истина. Люди сами расходятся на пограничных случаях: согласие двух экспертов в 85–90% — хороший уровень. Выше этого судью не откалибровать; цель — догнать согласие «судья — эксперт» до уровня «эксперт — эксперт», а не до ста процентов.

Когда судья годится, а когда нет

Годится: сравнение версий и скрининг. Ранжирование кандидатов, регрессионные прогоны перед релизом, сравнение промптов — решения относительные, судья на них надёжен после калибровки. О методике честного сравнения — в статье про кросс-валидацию.

Не годится: абсолютное качество в проде. «Средний балл судьи 8,2» не отвечает, сколько ошибок увидят пользователи: шкала условна, чувствительна к формату и смещается при дрейфе вопросов. Для эксплуатации считают поведенческие и операционные метрики — доли отказов, повторных обращений, эскалаций; об этом — про мониторинг ИИ-систем.

Не годится: высокорисковые решения без выборочной проверки. Юридическая корректность, медицинские границы, безопасность — судья не проверяет факты против внешних источников и наследует слепоту своей модели. Здесь судья максимум предварительный фильтр; решение — за человеком или отдельной проверкой.

Связка: судья на каждый прогон плюс ручная выборка. Автоматическая оценка всех итераций фильтрует и ранжирует; перед решениями, которые чего-то стоят — релиз, смена модели, — двадцать-тридцать ответов проверяются вручную по стратифицированной выборке: сегменты, включая случаи отказа. Это дешёвая форма человека в контуре.

Типичные ошибки

Верить абсолютным баллам. «8,2 стало 8,4» без калибровки и фиксированной конфигурации судьи — цифры из разных шкал; сравнимы только прогоны одного судьи с одним промптом на одном наборе.

Судья из того же семейства, что оцениваемая модель. Самопредпочтение смещает сравнение моделей; для выбора между моделями судью берут из другого семейства или калибруют по ручной паре.

Не перепроверять отказы. Без отдельного критерия система учится выдавать уверенный ответ вместо отказа — так оценивается выше; в эксплуатации это оборачивается выдумками на незнакомых вопросах.

Менять судью между итерациями. Обновление версии модели-судьи посреди серии экспериментов меняет шкалу, и сравнения с прошлым теряют силу. Версия судьи — часть конфигурации эксперимента.

Частые вопросы

Какую модель брать судьёй?

Из другого семейства, чем оцениваемая, и достаточно сильную, чтобы удерживать инструкцию с критериями, — обычно модели верхнего среднего класса или топовые. Слабый судья не удерживает рубрику и превращает оценку в шум; избыточно сильный не окупается на рутинных сравнениях.

Какую шкалу использовать?

Для парного сравнения — выбор лучшего с вариантом «ничья»; для одиночной — три-пять градаций с письменными определениями каждой. Десятибалльная шкала даёт ложную точность: соседние баллы судья устойчиво не различает.

Сколько стоит оценка судьёй?

Порядок — доли цента на ответ: 100–200 вопросов с контекстом — тысячи-десятки тысяч токенов на прогон. Дороже токенов — построение и калибровка промпта судьи: несколько часов ручной работы на старте и после каждого изменения задачи.

Можно ли судей несколько?

Да, и при разногласиях это надёжнее: два-три судьи из разных семейств, итог по большинству. Расход растёт кратно, поэтому панель оправдана для финальных приёмочных прогонов, а не для каждой итерации.

Чем судья отличается от автометрик вроде faithfulness?

Метрики вроде faithfulness считаются по формализованной процедуре — сверка утверждений ответа с фрагментами; судья оценивает свободные критерии текстом. Процедурные метрики воспроизводимее, судья гибче; на практике их комбинируют — про это статья про метрики качества RAG.

Что почитать по теме