Инференс против обучения — два режима существования нейросети: обучение меняет веса модели и происходит редко и дорого; инференс использует зафиксированные веса и происходит на каждом запросе. Практическая роль различия: оно определяет структуру затрат ИИ-проекта — разовые вложения против постоянной оплаты каждого обращения.
Два режима: что происходит с весами
Обучение производит модель. По примерам с известными ответами модель делает предсказания, ошибается, и каждый вес сдвигается в сторону уменьшения ошибки. Результат — артефакт: файл весов новой версии модели. Процесс требует данных, вычислений и людей; повторяется по мере необходимости.
Инференс использует модель. Веса заморожены: вход прогоняется через них, на выходе — ответ. Один запрос дёшев, и вся цена режима — в его частоте: миллион обращений в месяц — миллион оплат.
После обучения модель не меняется от использования. Обычная система не «учится на диалогах с пользователями»: то, что вы видите в работе, — зафиксированные веса. Если качество со временем растёт, значит, кто-то запускает цикл переобучения; если падает — начался дрейф данных.
Обучение: редкое и дорогое
Полное обучение с нуля — не для заказчика. Базовые языковые модели фронтир-размера обучаются на кластерах ускорителей неделями и месяцами; порядок затрат — от миллионов долларов, основная строка — вычисления и данные. Корпоративный проект берёт готовую базовую модель и при необходимости дообучает.
В смету обучения входит не только железо. Сбор и чистка данных, разметка, команда, эксперименты: каждая неудачная попытка тоже стоит денег. Типовой цикл — несколько итераций до приемлемого качества, и закладывать надо все, а не одну.
Дообучение — посередине. Полное дообучение большой модели всё ещё заметно по затратам; параметрически эффективные методы обучают малую добавку к замороженным весам: LoRA снижает требования к памяти в разы, QLoRA — ещё сильнее за счёт сжатия весов. Вычисления при этом перестают быть главной статьёй: данные и оценка качества обходятся дороже.
Инференс: дёшево на единицу, дорого в сумме
Каждый запрос оплачивается. При работе через API — токенами входа и генерации; при своей модели — железом, памятью и сопровождением. Стоимость линейна по числу обращений и длине контекста, поэтому экономику продукта считают на тысячу запросов, а не на один.
Своя модель — постоянные затраты. Аренда или покупка ускорителей, развёртывание, мониторинг, резервирование работают и тогда, когда обращений нет. Зато маржинальная стоимость запроса близка к нулю — этим своя модель выигрывает на больших стабильных потоках.
Инженерия инференса — отдельная дисциплина. Батчинг, кэширование, квантизация и выбор сервера влияют на цену и задержку; инженерная глубина — в статье «Инференс». Здесь важно лишь то, что эти рычаги оптимизируют расход, но не отменяют режим: плата за каждый вызов остаётся структурой затрат.
Экономика: заплатил один раз против платы за вызов
Обучение — капитальные затраты, инференс — операционные. После обучения артефакт остаётся у владельца; инференс оплачивается постоянно и растёт вместе с успехом продукта: чем больше пользователей, тем больше счёт. Успешный продукт с отрицательной юнит-экономикой запроса не спасёт никакое обучение.
Точка перелома считается, а не ощущается. На малых и средних нагрузках API почти всегда дешевле — нет железа и команды; на больших стабильных потоках своя модель с дообучением начинает выигрывать. Момент пересечения зависит от объёма, длины контекста и требований к данным, и проверяется расчётом полной стоимости владения — «Совокупная стоимость владения».
Дообучение не удешевляет запрос. Обученная под задачу модель работает за ту же цену за токен, если размер тот же; дообучение меняет поведение, а не экономику инференса. Снизить цену запроса могут сжатие весов или дистилляция в меньшую модель — это отдельные проекты со своей ценой ошибок.
Где уместно и когда нужно
Когда достаточно без дообучения. Готовая модель с инструкцией, примерами в промпте и поиском по базе знаний покрывает большинство корпоративных сценариев и обновляется мгновенной правкой данных. Дообучение — когда нужен устойчивый стиль, жёсткий формат или класс задач, который промптом не описать.
«Переобучим под вас» — вопрос про деньги и сроки. За фразой подрядчика всегда проект: какие данные, кто и за чей счёт размечает, сколько итераций до результата, чем измеряется успех, что происходит при дрейфе. Просите план итераций, критерий успеха на проверочном наборе, цену каждой следующей итерации и условие, кому принадлежат веса и адаптеры, обученные на ваших данных.
Планируйте переобучения как регулярность. Данные и язык обращений меняются, качество дрейфует; цикл «замер — дообучение — проверка» — операционный процесс с бюджетом, а не разовое событие. Как поймать момент — в статье «Дрейф данных».
Типичные ошибки
- Считать только стоимость обучения. Проект живёт в инференсе: если счёт за запросы превышает ценность автоматизации, обучение не окупится никогда. Экономика считается на горизонте года, с ростом нагрузки.
- Дообучение вместо данных в контексте. Пока факты меняются и объём невелик, поиск и промпт дешевле и обновляются мгновенно; дообучение фиксирует знания в весах, где их обновление — снова обучение.
- Не закладывать итерации. Первое обучение редко даёт целевое качество; в смете — минимум две–три итерации с данными и оценкой, иначе проект упирается в «неожиданные» расходы.
- Не фиксировать владение артефактом. Веса и адаптеры, обученные на ваших данных, должны оставаться у вас; иначе каждый следующий подрядчик начинает с нуля, привязка к исполнителю становится постоянной статьёй расходов.
- Сравнивать API и свою модель по цене одного запроса. Честное сравнение — по полной стоимости: разработка и обучение, железо или тарифы, сопровождение, переобучения, риск-запас на рост.
Частые вопросы
Модель учится на запросах пользователей?
В обычной эксплуатации нет: веса зафиксированы после обучения. «Дообучение на диалогах» — отдельный инженерный цикл: отбор, чистка, проверка качества, обучение новой версии и её релиз с контролем. Без явного цикла диалоги пользователей на поведение модели не влияют.
Сколько стоит дообучение?
Методом LoRA на небольшой модели — часы или дни работы одного ускорителя, но основная стоимость — подготовка данных и оценка качества. Полное дообучение большой модели дороже на порядок. Точная цифра появляется после пилота на ваших данных, до этого любые числа — оценка.
Когда своя модель выгоднее API?
При большом стабильном потоке обращений, жёстких требованиях к конфиденциальности или специфике языка, где общие модели проигрывают. Точку пересечения считают по полной стоимости владения; при малых нагрузках почти всегда дешевле API.
Что меняется в цене запроса после дообучения?
Почти ничего: модель того же размера обрабатывается за те же деньги. Дообучение меняет поведение; снизить цену запроса могут квантизация и дистилляция в меньшую модель — с отдельной проверкой потерь качества.
Можно ли обойтись совсем без обучения?
Да, и это типовой путь: готовая модель плюс промпт, примеры и поиск по базе знаний. Дообучение подключают, когда промпт и поиск исчерпали себя, а требования к стилю, формату или устойчивости остаются.
Почему подрядчик не может сразу назвать цену «переобучим под вас»?
Потому что основная стоимость — данные, которых подрядчик ещё не видел: сколько примеров, кто размечает, сколько итераций. Честный ответ — вилка и план пилота; фиксированная цена до взгляда на данные означает, что риск вшит в наценку.
Что почитать по теме
- Инференс — инженерная сторона режима: батчинг, кэширование, квантизация.
- LoRA и QLoRA — дешёвое дообучение адаптерами.
- Своя модель или API — выбор схемы поставки.
- TCO ИИ-решения — полная стоимость по статьям.
- Дрейф данных — почему переобучения становятся регулярными.