1. Главная
  2. Docs
  3. Глоссарий
  4. Обучение с учителем и без учителя

Обучение с учителем и без учителя

8

Обучение с учителем и без учителя — два классических режима машинного обучения, различающихся тем, есть ли у обучающих примеров правильные ответы. К ним добавился третий режим — самообучение (self-supervised), при котором модель сама составляет себе задачи из неразмеченных данных. Практическая роль режима: он определяет, какие данные нужны проекту, сколько они стоят и что модель сможет делать после обучения.

Обучение с учителем: есть правильные ответы

Механика. Модель учится на парах «вход — правильный ответ»: предсказание сравнивается с эталоном, ошибка корректирует веса. Режим даёт предсказуемый результат — модель учится повторять решения, заданные примерами.

Правильные ответы создаёт разметка. Эталоны не появляются сами: их пишет человек по инструкции. Качество разметки ограничивает потолок качества модели сверху — на противоречивых эталонах модель выучивает противоречие. Как строить разметку и контролировать её качество — в статье «Разметка данных».

Типичные задачи режима. Классификация обращений по темам и срочности, извлечение полей из документов, скоринг, оценка тональности. Общее условие: правильный ответ существует, его можно описать инструкцией и проверить.

Обучение без учителя: структура без ответов

Механика. Правильных ответов нет — модель ищет структуру в самих данных: разбивает примеры на кластеры похожих, выделяет аномалии, находит группы с общим поведением.

Практические применения. Сегментация клиентской базы, поиск аномальных транзакций, группировка обращений перед запуском классификатора. Последнее — самый экономный сценарий: кластеризация показывает, какие классы вообще есть в данных, и размечать можно по представителям кластеров, а не по всей массе.

Ограничение. На выходе — «похожие группы», а не «правильные категории»: интерпретация, названия и правила отнесения проверяет и задаёт человек. Режим не заменяет разметку, а делает её дешевле.

Самообучение: модель составляет задачи сама

Идея. Правильный ответ извлекается из самих данных без человека: у текста — предсказать следующий токен по предыдущим, у изображения — восстановить замаскированный участок или убрать шум из испорченной копии. Маскировка и зашумление — это автоматическая генерация миллионов пар «вход — ответ».

Почему это изменило отрасль. Снимается потолок ручной разметки: обучаться можно на триллионах токенов текста и миллиардах изображений без единого эталона, созданного человеком. Именно этот режим сделал возможными большие языковые модели и генераторы изображений — расшумление лежит в основе последних (подробнее — «Диффузионные модели»).

После самообучения — доводка поведения. Базовая модель умеет продолжать текст; чтобы она отвечала по инструкции, вежливо и по существу, поведение доводят отдельным этапом — RLHF, обучением на предпочтениях людей, которые выбирают лучший из ответов. Это доводка, а не новый способ получения знаний.

Что из этого следует для дообучения под задачу

Дообучение на практике — обучение с учителем. Когда модель дообучают под компанию, ей показывают пары «запрос — эталонный ответ» в нужном стиле и формате. Основной ресурс здесь не вычисления, а сбор и выверка примеров.

Разметка — главный скрытый проект. Объёмы от сотен до тысяч примеров, инструкции разметчикам, проверка согласованности, исправление после первых замеров. Первая версия разметки почти всегда переделывается, поэтому смета на данные должна быть отдельной строкой с запасом.

Метод дообучения — вопрос бюджета. Полное дообучение больших моделей дорого; параметрически эффективные методы вроде LoRA обучают малую добавку к замороженной модели и снижают требования к памяти в разы — «LoRA». Выбор метода не отменяет главного: данные и оценка стоят дороже вычислений.

Где какой режим нужен

Ориентир по задачам. Классификация, извлечение полей, скоринг — с учителем. Неизвестно, какие классы есть и сколько их — без учителя как разведка, затем разметка представителей. Генерация и понимание свободного текста — самообученная базовая модель плюс дообучение или поиск.

Экономный порядок действий. Сначала кластеризация чернового массива, затем разметка представителей кластеров, затем модель с учителем. Такой путь дешевле сплошной разметки в разы и сразу даёт карту данных: видно, какие классы малочисленны и где модель будет ошибаться чаще.

Когда дообучение вообще не нужно. Если задача решается готовой моделью с инструкцией и примерами в промпте или поиском по базе знаний, дообучение — избыточный расход. Дообучение оправдано, когда нужен устойчивый стиль, формат или класс задач, который промптом не описать.

Типичные ошибки

  • «Разметим по ходу». Разметка — не побочный эффект, а основной проект с методологией, инструкцией и контролем согласованности. Без этого половина бюджета уходит на переделку.
  • Разметка без проверки согласованности. Если два разметчика на одном примере дают разные ответы в существенной доле случаев, модель выучивает шум. Согласованность измеряется на пересекающейся выборке до запуска обучения.
  • Ожидание ответов от обучения без учителя. Без учителя получается структура, а не правильные категории. Требовать от кластеризации «правильной классификации» — ошибка режима.
  • Смешение терминов. Самообучение — это автоматические ответы в самих данных, а не «обучение без учителя» и не «модель учится сама в работе». После обучения веса зафиксированы; различие режимов — в статье «Инференс против обучения».
  • Начинать с дообучения. Пока случаев немного и данные меняются, примеры в промпте и поиск дешевле и обновляются мгновенно; дообучение — для стабильного повторяющегося паттерна.

Частые вопросы

Чем самообучение отличается от обучения без учителя?

При обучении без учителя правильных ответов нет вообще — ищется структура. При самообучении ответы есть, но создаются автоматически из самих данных: следующий токен, скрытый участок изображения. Разница практическая: самообучение даёт модели генеративные способности, а не только группировку.

Можно ли обойтись совсем без разметки?

Для базовых способностей — да, этим и пользуются готовые модели. Но для устойчивого качества на узкой задаче почти всегда нужна размеченная выборка хотя бы для оценки: без эталонов нельзя измерить, работает ли система. Оценочная выборка — минимальная обязательная разметка.

Сколько примеров нужно для дообучения?

Для классификатора — обычно сотни примеров на класс; для дообучения языковой модели на стиль и формат — от сотен до тысяч качественных пар «запрос — эталон». Качество и представительность важнее количества: тысяча чистых примеров работает лучше пяти тысяч шумных.

Что такое RLHF простыми словами?

Доводка поведения: людям показывают несколько вариантов ответа модели, они выбирают лучший, и модель сдвигают к выбранным. Знаний это не добавляет — меняет манеру и дисциплину ответов базовой модели, обученной самообучением.

Как проверить, что дообучение удалось?

Отложенной выборкой, не участвовавшей в обучении, и метриками задачи до и после: точность классификации, доля ответов в требуемом формате, качество извлечённых полей. Прирост должен быть измеренным, а не ощущаться на паре примеров.

Можно ли найти темы в обращениях клиентов без разметки?

Да, кластеризацией: модель без учителя группирует похожие обращения, дальше человек называет кластеры и решает, какие станут классами классификатора. Это стандартная разведка перед разметкой.

Что почитать по теме