Выбор модели — решение не про рейтинги, а про ограничения: где могут обрабатываться данные, сколько допустимо тратить на обращение, какая нужна скорость ответа и на каком железе всё это должно работать. Модель, лучшая по бенчмаркам, часто оказывается неподходящей по одному из этих пунктов.
В разделе: сравнение YandexGPT и GigaChat, открытые модели для русского языка, подбор модели под конкретную задачу, расчёт необходимой видеопамяти и квантизация, инструменты развёртывания, шлюзы моделей и миграция без переписывания системы.
Отдельно — тестирование: как проверить модель на своей задаче, а не доверять чужим замерам, и что делать, если зарубежная модель стала недоступна.