Выбор модели по принципу «возьмём самую сильную» кажется безопасным: качество не пострадает. Он и правда безопасен — просто дорог, а в значительной части задач избыточен.
Причина в том, что крупные модели сильны там, где нужно рассуждать: связывать разрозненные условия, строить длинные цепочки выводов, работать с неочевидными формулировками. В типовых бизнес-задачах рассуждения обычно не требуется — требуется правильно прочитать текст и вернуть определённый результат.
С этим небольшие модели справляются, а стоят и весят кратно меньше.
Что относится к «малым»
Границы условны, но порядок такой:
| Условный класс | Параметров | Где работает |
|---|---|---|
| Очень малые | до 1–3 млрд | на процессоре, на устройстве |
| Малые | 3–8 млрд | одна потребительская видеокарта |
| Средние | 8–30 млрд | карта с большим объёмом |
| Крупные | больше 30 млрд | серверное решение или облако |
Со сжатием весов границы сдвигаются — «Квантизация». Расчёт требований — «Расчёт видеопамяти».
Задачи, где малой модели достаточно
Общий признак: вход надо понять, а не осмыслить.
Классификация. Определить тему обращения, срочность, тип документа. Одна из самых благодарных задач для небольшой модели — «Классификация обращений».
Извлечение явно указанных полей. Номер, дата, сумма, контрагент — когда они в документе есть и написаны, а не выводятся.
Приведение к формату. Переписать в заданной структуре, нормализовать, разложить по полям.
Определение тональности и признаков. Разбор отзывов, выявление претензий.
Короткие сводки. Свести переписку к сути.
Маршрутизация. Решить, куда направить обращение.
Отсев. Определить, относится ли обращение к теме вообще.
Где малой модели не хватает
Сложные рассуждения. Задачи с несколькими взаимосвязанными условиями, где нужно удержать всё сразу.
Длинный контекст. Небольшие модели хуже работают с объёмными входами.
Нестандартные формулировки. На типовом потоке разницы нет, на редких и странных случаях она проявляется.
Развёрнутые тексты для людей. Ответ клиенту, пояснительная записка — там заметна разница в качестве языка.
Задачи, требующие широких знаний о мире.
Во сколько раз дешевле
Экономия идёт по трём линиям одновременно.
| Линия | Порядок разницы |
|---|---|
| Цена за обращение в облаке | обычно кратная, иногда на порядок |
| Требования к оборудованию | кратные |
| Скорость ответа | в несколько раз быстрее |
Третья строка часто важнее первой: для сценариев, где ответ ждёт человек, разница между секундой и тремя ощутима. Для голосовых сценариев — определяющая.
Схема, которая обычно лучше обеих
Не «малая или крупная», а малая на потоке, крупная на остатке.
Как устроено:
- Малая модель обрабатывает все обращения.
- Программные проверки и флаг неуверенности определяют, где результат сомнителен.
- Сомнительное переобрабатывается крупной моделью.
- Что осталось сомнительным — человеку.
При типичном распределении, когда основная часть потока — типовые случаи, крупная модель вызывается на небольшой доле обращений. Итоговая стоимость близка к стоимости малой модели, качество — к крупной.
Требует общего слоя доступа к моделям, иначе маршрутизация расползётся по коду — «Шлюз моделей». И требует признака неуверенности — «Структурированный вывод модели».
Разбор: сколько на самом деле нужно крупной модели
Задача. Разбор входящих обращений: категория, срочность, извлечение контактов и номера заказа. Поток около 6 000 в месяц.
Как было. Всё обрабатывалось крупной облачной моделью. Работало хорошо, стоило заметно.
Что проверили. Собрали 200 реальных обращений с проверенными результатами и прогнали через три модели: крупную, среднюю и малую.
| Класс обращений | Доля потока | Малая | Средняя | Крупная |
|---|---|---|---|---|
| Типовые, ясно сформулированные | ~70% | справляется | справляется | справляется |
| С опечатками, обрывочные | ~20% | иногда ошибается | справляется | справляется |
| Многотемные, запутанные | ~10% | плохо | иногда ошибается | справляется |
Что сделали. Ввели двухступенчатую схему: малая модель обрабатывает всё, при срабатывании проверок или флага неуверенности обращение переобрабатывается крупной.
Признаки сомнения: не прошёл формат номера заказа, не определилась категория однозначно, обнаружено несколько тем, модель выставила флаг неуверенности.
Что получилось. Крупная модель стала вызываться примерно на четверти обращений вместо ста процентов. Качество на контрольном наборе осталось на прежнем уровне — переобработка вылавливала как раз те случаи, где малая ошибалась.
Стоимость обработки сократилась кратно. Среднее время ответа тоже снизилось: три четверти обращений обрабатывались быстрой моделью.
Что не сработало сразу. Первая версия признаков сомнения была слишком узкой — только программные проверки формата. Часть ошибок малой модели их проходила: категория определялась неверно, но формально правдоподобно. Добавили явный флаг неуверенности в схему ответа и сравнение с результатом повторного прогона на спорных случаях.
Что стоит забрать. Вопрос был не «какая модель лучше», а «на какой доле потока действительно нужна сильная». Ответ — на меньшей, чем предполагалось, и определяется он измерением, а не рассуждением.
Как проверить, хватит ли малой модели
Соберите набор из реальных случаев, обязательно включая нетипичные.
Прогоните малую и крупную на одинаковом промпте.
Разбейте результаты по классам случаев, а не смотрите среднее. Ключевой вопрос — не «насколько малая хуже в среднем», а «на каких случаях она ошибается и какова их доля».
Проверьте соблюдение формата отдельно. Малые модели чаще нарушают схему — для конвейеров это критично.
Посмотрите, можно ли распознать сложные случаи заранее. Если да, схема с двумя моделями заработает.
Методика — «Тестирование модели на своей задаче».
Частые вопросы
Какие задачи решаются малыми моделями?
Те, где вход надо понять, а не осмыслить: классификация обращений, извлечение явно указанных полей, приведение текста к формату, определение тональности, короткие сводки, маршрутизация. Сложные рассуждения, работа с длинным контекстом и написание развёрнутых текстов для людей даются им заметно хуже.
Насколько дешевле малая модель?
Экономия идёт по трём линиям: цена за обращение обычно кратная, требования к оборудованию кратные, скорость в несколько раз выше. Последнее часто важнее денег — в сценариях, где ответ ждёт человек, разница между секундой и тремя заметна.
Стоит ли использовать разные модели на разных шагах?
Да, это одна из самых действенных мер по сокращению расходов. Ещё лучше работает двухступенчатая схема: малая модель обрабатывает весь поток, а сомнительные случаи переобрабатываются крупной. Стоимость близка к малой, качество — к крупной.
Как определить, что результат малой модели сомнителен?
Программными проверками — формат, контрольные суммы, наличие значения в справочнике — и явным флагом неуверенности в схеме ответа. Только проверок формата обычно недостаточно: часть ошибок выглядит формально правдоподобно.
Можно ли дообучить малую модель под задачу?
Да, и на узкой повторяющейся задаче это часто оправдано: дообученная малая модель заменяет крупную, а экономия на эксплуатации окупает работу. Требуются размеченные примеры — «LoRA и QLoRA».
Хуже ли малые модели работают с русским языком?
Как правило, разрыв на русском заметнее, чем на английском: чем меньше модель, тем сильнее сказывается доля языка в обучающих данных. Это дополнительный довод проверять на своих русскоязычных данных, а не переносить чужие выводы.
Что дальше
Общие критерии выбора — «Выбор модели под задачу». Где разместить маршрутизацию между моделями — «Шлюз моделей». Требования к железу — «Расчёт видеопамяти». Другие способы сократить счёт — «Длина контекста и стоимость».
Подбор модели под каждый шаг процесса — часть работы по разработке и внедрению ИИ.