1. Главная
  2. Блог
  3. RAG и базы знаний
  4. Эмбеддинги для русского языка: как выбрать модель векторизации

Эмбеддинги для русского языка: как выбрать модель векторизации

14 августа 2026
14

Эмбеддинг — это перевод текста в набор чисел так, чтобы близкие по смыслу тексты давали близкие наборы. Вся смысловая часть поиска в RAG держится на этом преобразовании, поэтому выбор модели влияет на качество сильнее, чем выбор языковой модели, которая пишет ответ.

С русским языком выбор сложнее, чем с английским, и не потому, что моделей мало. Их достаточно. Сложность в том, что общие рейтинги не отвечают на ваш вопрос: они измеряют среднее по чужим задачам, а вам нужно качество на вашем корпусе с вашей терминологией.

Ниже — признаки, по которым выбирают, и способ проверить выбор за день. Конкретных названий моделей я намеренно почти не привожу: они меняются быстрее, чем устаревает эта статья, а критерии остаются.

Классы моделей

Многоязычные общего назначения. Обучены на десятках языков, русский среди них. Практичный выбор по умолчанию: работают приемлемо, доступны, регулярно обновляются. Обычно с них и начинают.

Специализированные под русский. Обучены преимущественно на русских текстах. Могут выигрывать на морфологии и разговорных формулировках. Проверять стоит, но выигрыш не гарантирован — многоязычные модели последних поколений подтянулись.

Отраслевые. Дообученные на текстах конкретной области — юридических, медицинских, технических. Если такая есть под вашу тематику, стоит проверить: узкая терминология обычно даётся им лучше.

Дообученные на своих данных. Крайний вариант: взять базовую модель и дообучить на парах «вопрос — правильный фрагмент» из вашей практики. Даёт лучший результат, но требует размеченных данных и повторной работы при их накоплении. Оправдано, когда всё остальное исчерпано.

Признаки, по которым выбирают

Качество на вашей терминологии

Главный признак, и его нельзя взять из рейтинга. Модель, отлично работающая на новостях и обзорах, может плохо различать ваши профессиональные термины просто потому, что не видела их при обучении.

Проверяется только на своих данных — как именно, ниже.

Размер вектора

Больше чисел — обычно точнее, но дороже хранение и медленнее поиск. Разница между небольшими и крупными векторами на практике заметна на объёмах от сотен тысяч фрагментов, а на десятках тысяч почти не видна.

Отдельно: часть современных моделей позволяет укорачивать вектор без переобучения — можно хранить сокращённый вариант и терять немного качества ради экономии. Полезное свойство при больших корпусах.

Длина входа

Сколько текста модель принимает за раз. Если ваши фрагменты крупные, а модель принимает мало, хвост фрагмента просто не попадёт в вектор — и содержимое хвоста станет ненаходимым. Это надо согласовывать с нарезкой.

Где она работает

Определяющий признак для организаций с требованиями к обработке данных. Модель по подписке означает, что тексты уходят наружу — включая внутренние документы при индексации. Локальная модель работает в вашем контуре — «Локальное развёртывание LLM». Правовая сторона — «152-ФЗ и нейросети».

Хорошая новость: модели векторизации небольшие. Им не нужна инфраструктура уровня генеративных моделей, и локальное развёртывание обычно недорого.

Стоимость и скорость

Индексация корпуса — разовая нагрузка, её можно потерпеть. А вот векторизация вопроса происходит на каждый запрос и входит во время ответа.

Симметричность

Тонкость, которую часто упускают. Часть моделей обучена сравнивать похожие тексты между собой, часть — короткий вопрос с длинным документом. Это разные задачи. Для RAG нужен второй тип, и у таких моделей обычно есть требование дописывать служебные пометки к вопросу и к фрагменту.

Если пометки не проставить, качество падает, причём молча — система работает, просто хуже. Это одна из самых частых и самых незаметных ошибок при внедрении.

Правило, которое нельзя нарушать

Вопрос и фрагменты векторизуются одной моделью. Векторы разных моделей несравнимы: они живут в разных пространствах, и близость между ними ничего не значит.

Отсюда следствие: смена модели требует переиндексации всего корпуса. Это не мелочь при больших объёмах, и это стоит учесть при выборе — «Обновление базы знаний без переиндексации».

Как проверить выбор на своих данных

Единственный способ выбрать осмысленно. Занимает день.

Шаг 1. Соберите набор. 50–100 реальных вопросов и для каждого — фрагмент, который на него отвечает. Берите вопросы из переписки и обращений, а не придумывайте: придуманные формулируются словами документа и потому находятся всегда.

Шаг 2. Проиндексируйте корпус каждой моделью-кандидатом. Три-четыре кандидата достаточно.

Шаг 3. Измерьте. По каждому вопросу проверьте, попал ли правильный фрагмент в первую пятёрку и на каком месте. Методика — «Метрики RAG».

Шаг 4. Посмотрите на провалы отдельно. Не только на среднее число. Часто одна модель лучше в среднем, но систематически проваливает важный класс вопросов — и это решает выбор.

Шаг 5. Сравните с расходами. Если разница в качестве невелика, побеждает та, что дешевле и работает в вашем контуре.

Разбор: почему «лучшая по рейтингу» проиграла

Задача. База знаний строительной компании: сметы, техусловия, регламенты, переписка с подрядчиками.

Что сделали сначала. Выбрали модель по общему рейтингу — она занимала верхние строчки на многоязычных наборах.

Симптом. Поиск работал прилично на общих вопросах и плохо на профессиональных. Вопросы вида «какие требования к армированию по узлу 4» находили что-то смежное, но не нужное.

Что показала проверка на своём наборе. Собрали 80 реальных вопросов из переписки с прорабами. Прогнали через четыре модели.

Модель из верха рейтинга оказалась третьей из четырёх на этом наборе. Выиграла модель скромнее по общим показателям, но заметно лучше различавшая профессиональную терминологию.

Разбор провалов показал причину: в отраслевых текстах много сокращений и обозначений узлов, которые для «универсальной» модели выглядят шумом. Модель, видевшая при обучении больше технических текстов, различала их лучше.

Второе, что нашли. У выбранной модели была та самая асимметрия: требовались служебные пометки для вопроса и для документа. Изначально их не ставили, и это само по себе стоило заметной доли качества — до простановки пометок эта модель тоже показывала посредственный результат и чуть не была отброшена.

Что в итоге. Взяли отраслевую модель с правильными пометками, развернули локально — требования заказчика к обработке данных этого требовали. Стоимость эксплуатации оказалась ниже подписки, а качество на своём наборе выше.

Вывод. Рейтинг отвечает на вопрос «какая модель лучше в среднем по чужим задачам». Ваш вопрос другой: «какая лучше на моих текстах и моих вопросах». Ответы совпадают не всегда, а проверка стоит одного дня.

Частые вопросы

Какую модель эмбеддингов выбрать для русского языка?

Ту, что лучше работает на вашем корпусе, — и это проверяется измерением, а не рейтингом. Разумная последовательность: взять современную многоязычную модель как отправную точку, собрать набор из 50–100 реальных вопросов и сравнить с двумя-тремя альтернативами, включая специализированные под русский и отраслевые.

Можно ли использовать англоязычную модель для русских текстов?

Технически да, качество будет заметно хуже. Русская морфология, порядок слов и словообразование отличаются достаточно, чтобы это сказалось на поиске. Берите многоязычную или специализированную.

Что будет, если поменять модель эмбеддингов?

Придётся переиндексировать весь корпус: векторы разных моделей несравнимы между собой. При большом объёме это заметная операция, и её стоит закладывать в план заранее.

Насколько важен размер вектора?

Меньше, чем кажется. На корпусах в десятки тысяч фрагментов разница между небольшими и крупными векторами обычно незначительна, а хранение и скорость поиска различаются заметно. Часть современных моделей позволяет укорачивать вектор с небольшой потерей качества.

Что за служебные пометки к тексту и зачем они нужны?

Некоторые модели обучены различать роли: короткий вопрос и длинный документ обрабатываются по-разному, и для этого к тексту дописывается служебный префикс. Если требование модели проигнорировать, качество поиска падает, причём молча — система продолжает работать, просто хуже.

Нужно ли дообучать модель на своих данных?

Обычно нет, во всяком случае не в начале. Дообучение требует размеченных пар «вопрос — правильный фрагмент» и повторной работы по мере их накопления. Оправдано, когда выбор из готовых моделей исчерпан, а качество поиска остаётся недостаточным.

Что дальше

Модель векторизации — только половина поиска: обозначения и коды она не различает, и это закрывает «Гибридный поиск». Размер фрагмента надо согласовать с длиной входа модели — «Чанкинг документов». Как измерять качество выбора — «Метрики RAG».

Подбор и проверка моделей на вашем корпусе, включая локальное развёртывание, — часть работы по разработке и внедрению ИИ.