1. Главная
  2. Блог
  3. Модели и инфраструктура
  4. Мультимодальные модели: где они действительно нужны

Мультимодальные модели: где они действительно нужны

15 августа 2026
29

Мультимодальные модели принимают на вход не только текст: изображения, документы как картинки, звук. Возможность эффектная, и вокруг неё много ожиданий, часть которых не оправдывается.

Практическая рамка простая: мультимодальная модель выигрывает там, где нужно понять содержание, и проигрывает там, где нужна точность. Специализированный инструмент распознавания текста точнее в извлечении символов; модель лучше понимает, что на странице изображено и как это связано.

Отсюда и распределение задач.

Где выигрывает

Сложная вёрстка документа. Многоколоночный текст, таблицы с объединёнными ячейками, схемы с подписями. Классическое распознавание такое ломает: порядок чтения теряется, таблица превращается в кашу. Модель, видящая страницу целиком, справляется лучше — «OCR и PDF».

Понимание изображения по существу. Что изображено на фото, есть ли дефект, соответствует ли снимок описанию.

Рукописные пометки. Резолюции на документах, подписи на полях.

Фотографии документов от клиентов. Снятые под углом, с бликами, частично обрезанные. Специализированное распознавание на таком часто отказывает, модель нередко справляется.

Скриншоты и интерфейсы. Разбор того, что человек прислал скриншотом.

Разбор чертежей и схем на уровне «что тут изображено», а не точных размеров.

Где проигрывает

Точное извлечение символов. Специализированное распознавание надёжнее там, где нужно прочитать длинный номер или строку цифр без ошибок.

Числа и суммы. Модель может ошибиться в цифре, и ошибка будет молчаливой. Все проверки, обязательные при извлечении данных, здесь тем более необходимы — «Извлечение данных из документов».

Измерения по изображению. Размеры, координаты, точное положение объектов.

Массовая однотипная обработка. Если документы одинаковы, специализированное решение будет дешевле и быстрее.

Стоимость. Обработка изображения обходится существенно дороже обработки того же объёма текста.

Про стоимость — отдельно

Момент, который недооценивают при планировании.

Изображение превращается во внутреннее представление, эквивалентное некоторому числу токенов, и это число зависит от разрешения. Одна страница документа в высоком разрешении может стоить как несколько страниц текста.

Практические следствия:

  • проверьте, не завышено ли разрешение. Часто хватает меньшего, а стоимость падает кратно;
  • обрезайте лишнее. Если нужна только шапка документа, не отправляйте страницу целиком;
  • не отправляйте изображение, если есть текстовый слой. Частая ошибка: PDF с извлекаемым текстом обрабатывают как картинку;
  • считайте на реальном потоке«Длина контекста и стоимость».

Разбор: смешанная схема для архива документов

Задача. Обработка входящих документов: часть приходит электронными файлами, часть сканами, часть фотографиями от клиентов из мессенджеров.

Что попробовали сначала. Отдать всё мультимодальной модели: она справляется со всеми видами, значит один путь вместо трёх.

Что получилось. Работало, но обнаружились две проблемы.

Стоимость оказалась примерно вчетверо выше расчётной. Причина — документы отправлялись в исходном разрешении, включая те, что имели нормальный текстовый слой и картинкой быть не должны были.

Точность на длинных номерах была хуже, чем у специализированного распознавания: модель ошибалась в отдельных цифрах, и ошибка выглядела правдоподобно.

Что сделали.

Ввели разделение по типу входа:

Вид входа Обработка
PDF с текстовым слоем извлечение текста, модель не нужна
Ровный скан типовой формы специализированное распознавание
Сложная вёрстка, таблицы мультимодальная модель
Фото от клиента мультимодальная модель
Рукописные пометки мультимодальная модель

Снизили разрешение отправляемых изображений до достаточного — проверили на наборе, что качество не упало.

Все извлечённые реквизиты стали проверяться программно: контрольные суммы, форматы, сверка суммы прописью и цифрами.

Результат. Доля документов, попадающих к мультимодальной модели, сократилась примерно до четверти. Стоимость обработки снизилась кратно, точность на номерах выросла за счёт проверок.

Что стоит забрать. Мультимодальная модель оказалась правильным инструментом — но для четверти потока, а не для всего. Определение того, какой вход куда направить, само по себе решается простыми правилами и стоит копейки.

Звук

Отдельная область с той же логикой.

Распознавание речи — специализированная задача, и специализированные системы обычно точнее для чистого преобразования речи в текст.

Мультимодальные модели со звуком полезнее там, где нужно не расшифровать, а понять: интонация, кто говорит, что произошло в разговоре.

Практичная схема для звонков: распознавание речи специализированной системой, затем разбор расшифровки текстовой моделью — сводка, обещания, следующий шаг. Именно так это обычно и делается — «Автоматизация рутины в CRM».

Полностью мультимодальная обработка звука оправдана в голосовых сценариях реального времени, где важна задержка — «Голосовой бот».

Что проверить до внедрения

  1. Есть ли текстовый слой у части входящих файлов. Если да, эту часть обрабатывать как текст.
  2. Однотипны ли документы. Если да, специализированное решение дешевле.
  3. Нужна ли точность в символах или достаточно понимания содержания.
  4. Какое разрешение достаточно. Проверяется на наборе, обычно меньше исходного.
  5. Какова доля сложных случаев. От неё зависит, во что обойдётся поток.
  6. Куда уходят изображения. Документы с персональными данными — «152-ФЗ и нейросети».

Частые вопросы

Заменяет ли мультимодальная модель распознавание текста?

Не заменяет, а дополняет. Специализированное распознавание точнее в извлечении символов, особенно длинных номеров, и дешевле на однотипных документах. Модель лучше справляется со сложной вёрсткой, таблицами, рукописными пометками и фотографиями плохого качества.

Насколько дорого обрабатывать изображения?

Заметно дороже текста: одна страница в высоком разрешении может стоить как несколько страниц текста, и стоимость растёт с разрешением. Первое, что стоит проверить, — не отправляете ли вы изображения там, где есть извлекаемый текстовый слой, и не завышено ли разрешение.

Можно ли доверять числам, извлечённым из изображения?

Только с проверками. Модель может ошибиться в цифре, и ошибка будет молчаливой — результат выглядит правдоподобно. Контрольные суммы, сверка итога с суммой строк, сопоставление суммы прописью и цифрами обязательны.

Что лучше для звонков — мультимодальная модель или распознавание речи?

Для точной расшифровки — специализированное распознавание, затем разбор текста обычной моделью. Мультимодальная обработка звука оправдана в голосовых сценариях реального времени, где важна задержка, и там, где нужна интонация, а не только слова.

Как понять, нужна ли нам мультимодальная модель?

Посмотреть на состав входящих документов: есть ли текстовый слой, однотипны ли формы, много ли сложной вёрстки и фотографий от клиентов. Часто выясняется, что модель нужна для меньшей части потока, а остальное дешевле обработать проще.

Работают ли они с русским языком в документах?

Да, но качество стоит проверить на своих документах — особенно на рукописном тексте и на специфических формах. Как и в других задачах, общие утверждения о качестве заменяются проверкой на наборе из реальных случаев.

Что дальше

Извлечение текста из документов в целом — «OCR и PDF». Проверки извлечённых данных — «Извлечение данных из документов». Как считать стоимость — «Длина контекста и стоимость». Общие критерии выбора — «Выбор модели под задачу».

Проектирование обработки документов со смешанными типами входа — часть работы по разработке и внедрению ИИ.