Разметка данных — ручное присвоение примерам эталонных ответов: класса обращения, границ сущностей в документе, правильного ответа на вопрос. В ИИ-проектах она нужна там, где требуется обучить или измерить: без эталона модели нечему учиться и не с чем сравнивать результат.
Где уместна и когда нужна разметка
Три типовые задачи. Обучение классификатора обращений, дообучение модели на своих примерах, эталонный набор для оценки качества — про последний отдельно написано в статье «Проверочный набор и бенчмарк». Во всех трёх разметка — не вспомогательная работа, а основной источник качества.
Иногда можно обойтись без массовой разметки. Если задача решается готовой моделью с промптом и примерами, размечается только проверочный набор — порядка 100–300 примеров. Мерить качество нужно всегда; учить на своих данных — только когда промпт не дотягивает и это подтверждено замером.
Разметка для оценки строже разметки для обучения. Эталон для оценки размечается с двойной выверкой: ошибка в нём напрямую искажает все метрики. Обучающий корпус терпит некоторый шум — модель усредняет, метрика — нет.
Инструкция разметчикам — главный артефакт
Содержание инструкции. Определения классов без пересечений, правила для граничных случаев с готовыми решениями, 5–10 эталонных примеров на класс, порядок действий при сомнении: не выдумывать, а пометить как спорный. Инструкция без граничных случаев бесполезна — разметчики не должны угадывать замысел.
Инструкция — живой документ с версиями. Вопросы разметчиков стекаются в дополнения, каждая правка получает номер версии и дату. Уточнение правил без фиксации версий портит корпус: ранние партии размечены по старым правилам, поздние — по новым, корпус внутренне противоречив.
Заказчик подтверждает примеры до старта. Если бизнес-эксперт не посмотрел эталонные примеры, разметка идёт по формальным признакам мимо бизнес-смысла. Согласование пятидесяти примеров перед партией дешевле, чем переразметка партии после.
Двойная разметка и согласованность
Независимая разметка двумя-тремя людьми. Пересекающаяся часть корпуса — обычно 10–20% или не менее пары сотен примеров — размечается независимо; по совпадениям считается согласованность.
Мера согласованности — каппа. Это доля совпадений, очищенная от случайных: ноль означает совпадения на уровне случайного угадывания, единица — полное согласие. Рабочие ориентиры: ниже 0,4 — задача не определена, инструкцию надо переписывать; 0,6–0,8 — рабочий уровень; выше 0,8 — хорошо. Формула исполнителю не нужна — нужна интерпретация и порог, ниже которого работа останавливается.
Низкая каппа лечится инструкцией, а не заменой людей. Совпадения не растут от смены исполнителей — растут от уточнения критериев и граничных случаев. Спорные примеры разбираются с арбитром-экспертом, решения уходят в инструкцию.
Согласованность ограничивает качество сверху. Модель не может быть согласована с эталоном лучше, чем разметчики между собой: каппа разметки — потолок достижимой точности. Поэтому согласованность меряется до обучения, а не после.
Стоимость, сроки и активное обучение
Скорость зависит от задачи. Классификация коротких обращений по закрытому списку — 20–60 секунд на пример, порядка 500–1500 примеров в день на разметчика. Выделение сущностей в документах — минуты на документ; сложные случаи с открытыми категориями — десятки минут: там разметчик фактически проектирует онтологию.
Типовые объёмы и сроки. Эталон для оценки на 300–500 примеров — несколько дней одного человека; корпус на 2–5 тысяч примеров для классификатора — одна–две недели команды из двух-трёх разметчиков при готовой инструкции. Без готовой инструкции сроки умножаются на переделки.
Активное обучение экономит разметку. Вместо равномерной разметки всего: стартовая случайная партия порядка 200–500 примеров, обучение первой модели, затем размечаются в первую очередь случаи, где модель ошибается или не уверена. На типовых задачах это сокращает нужный объём разметки в 2–3 раза при том же итоговом качестве — проверяется на своём распределении, а не берётся на веру.
Типичные ошибки
- Критерии «на глаз». Без письменных определений согласованность не удержать, а зашумлённый эталон ограничивает качество модели сверху: ошибка инструкции тиражируется на всю партию.
- Дрейф инструкции без версий. Правила уточнялись по ходу, ранние партии не переразмечены: модель учится на противоречивых метках и наследует противоречия.
- Заказчик не смотрит примеры. Разметка формально выполнена и сдана, по смыслу мимо бизнес-критериев; выясняется это на приёмке, когда бюджет уже выбран.
- Классы с пересечениями. «Жалоба или вопрос» без правила для смешанных обращений — гарантированные споры и низкая каппа; граничные случаи описываются заранее.
- Равномерная разметка всего корпуса. Без активного обучения дорогой ресурс тратится на примеры, которые модель и так решает; сложные случаи остаются без внимания.
- Нет золотых примеров в потоке. Без контрольных заданий с известными ответами, подмешанных к рабочим, деградация разметчиков незаметна до аудита готового корпуса.
Частые вопросы
Сколько примеров нужно разметить?
Для проверочного набора — 100–300; для обучения классификатора — от нескольких сотен на класс для стартовой версии. Дальше объём определяется по кривой: качество перестало расти на валидации — разметка остановлена.
Кто должен размечать?
Массовую разметку по готовой инструкции — обученные разметчики, сложные доменные случаи — специалисты процесса, арбитраж спорных — эксперт бизнеса. Смешение ролей без арбитража приводит к тихому расщеплению критериев.
Как контролировать разметчиков?
Двойная разметка с расчётом каппы на старте и контрольных точках, золотые примеры с известными ответами в потоке, разбор спорных с арбитром. Контроль по принципу «принял или не принял» без числовой согласованности не работает.
Что делать при низкой каппе?
Переписывать инструкцию: уточнить определения, добавить граничные случаи и примеры, сузить пересечения классов. Смена исполнителей при низкой каппе почти никогда не помогает — проблема в задании, а не в людях.
Можно ли размечать силами модели?
Предразметка моделью с ручной выверкой ускоряет работу в 2–4 раза на типовых задачах. Итоговый эталон подтверждает человек, иначе оценка качества превращается в само-оценку модели её же ответами.
Сколько стоит разметка?
Основные статьи — ставки разметчиков и время экспертов на инструкцию и арбитраж; по опыту ML-проектов это сопоставимо с затратами на разработку самого решения. Точная оценка — пробной партией в 200–300 примеров с замером скорости.
Что почитать по теме
- Проверочный набор и бенчмарк — куда идёт эталонная разметка.
- Обучение с учителем и без учителя — место разметки в спектре задач.
- Матрица ошибок — что делать с размеченными результатами дальше.
- Обучение на своих данных — когда разметка окупается дообучением.
- NER — типовая задача, где разметка границ сущностей сложнее классификации.