Мультимодальные модели принимают на вход не только текст: изображения, документы как картинки, звук. Возможность эффектная, и вокруг неё много ожиданий, часть которых не оправдывается.
Практическая рамка простая: мультимодальная модель выигрывает там, где нужно понять содержание, и проигрывает там, где нужна точность. Специализированный инструмент распознавания текста точнее в извлечении символов; модель лучше понимает, что на странице изображено и как это связано.
Отсюда и распределение задач.
Где выигрывает
Сложная вёрстка документа. Многоколоночный текст, таблицы с объединёнными ячейками, схемы с подписями. Классическое распознавание такое ломает: порядок чтения теряется, таблица превращается в кашу. Модель, видящая страницу целиком, справляется лучше — «OCR и PDF».
Понимание изображения по существу. Что изображено на фото, есть ли дефект, соответствует ли снимок описанию.
Рукописные пометки. Резолюции на документах, подписи на полях.
Фотографии документов от клиентов. Снятые под углом, с бликами, частично обрезанные. Специализированное распознавание на таком часто отказывает, модель нередко справляется.
Скриншоты и интерфейсы. Разбор того, что человек прислал скриншотом.
Разбор чертежей и схем на уровне «что тут изображено», а не точных размеров.
Где проигрывает
Точное извлечение символов. Специализированное распознавание надёжнее там, где нужно прочитать длинный номер или строку цифр без ошибок.
Числа и суммы. Модель может ошибиться в цифре, и ошибка будет молчаливой. Все проверки, обязательные при извлечении данных, здесь тем более необходимы — «Извлечение данных из документов».
Измерения по изображению. Размеры, координаты, точное положение объектов.
Массовая однотипная обработка. Если документы одинаковы, специализированное решение будет дешевле и быстрее.
Стоимость. Обработка изображения обходится существенно дороже обработки того же объёма текста.
Про стоимость — отдельно
Момент, который недооценивают при планировании.
Изображение превращается во внутреннее представление, эквивалентное некоторому числу токенов, и это число зависит от разрешения. Одна страница документа в высоком разрешении может стоить как несколько страниц текста.
Практические следствия:
- проверьте, не завышено ли разрешение. Часто хватает меньшего, а стоимость падает кратно;
- обрезайте лишнее. Если нужна только шапка документа, не отправляйте страницу целиком;
- не отправляйте изображение, если есть текстовый слой. Частая ошибка: PDF с извлекаемым текстом обрабатывают как картинку;
- считайте на реальном потоке — «Длина контекста и стоимость».
Разбор: смешанная схема для архива документов
Задача. Обработка входящих документов: часть приходит электронными файлами, часть сканами, часть фотографиями от клиентов из мессенджеров.
Что попробовали сначала. Отдать всё мультимодальной модели: она справляется со всеми видами, значит один путь вместо трёх.
Что получилось. Работало, но обнаружились две проблемы.
Стоимость оказалась примерно вчетверо выше расчётной. Причина — документы отправлялись в исходном разрешении, включая те, что имели нормальный текстовый слой и картинкой быть не должны были.
Точность на длинных номерах была хуже, чем у специализированного распознавания: модель ошибалась в отдельных цифрах, и ошибка выглядела правдоподобно.
Что сделали.
Ввели разделение по типу входа:
| Вид входа | Обработка |
|---|---|
| PDF с текстовым слоем | извлечение текста, модель не нужна |
| Ровный скан типовой формы | специализированное распознавание |
| Сложная вёрстка, таблицы | мультимодальная модель |
| Фото от клиента | мультимодальная модель |
| Рукописные пометки | мультимодальная модель |
Снизили разрешение отправляемых изображений до достаточного — проверили на наборе, что качество не упало.
Все извлечённые реквизиты стали проверяться программно: контрольные суммы, форматы, сверка суммы прописью и цифрами.
Результат. Доля документов, попадающих к мультимодальной модели, сократилась примерно до четверти. Стоимость обработки снизилась кратно, точность на номерах выросла за счёт проверок.
Что стоит забрать. Мультимодальная модель оказалась правильным инструментом — но для четверти потока, а не для всего. Определение того, какой вход куда направить, само по себе решается простыми правилами и стоит копейки.
Звук
Отдельная область с той же логикой.
Распознавание речи — специализированная задача, и специализированные системы обычно точнее для чистого преобразования речи в текст.
Мультимодальные модели со звуком полезнее там, где нужно не расшифровать, а понять: интонация, кто говорит, что произошло в разговоре.
Практичная схема для звонков: распознавание речи специализированной системой, затем разбор расшифровки текстовой моделью — сводка, обещания, следующий шаг. Именно так это обычно и делается — «Автоматизация рутины в CRM».
Полностью мультимодальная обработка звука оправдана в голосовых сценариях реального времени, где важна задержка — «Голосовой бот».
Что проверить до внедрения
- Есть ли текстовый слой у части входящих файлов. Если да, эту часть обрабатывать как текст.
- Однотипны ли документы. Если да, специализированное решение дешевле.
- Нужна ли точность в символах или достаточно понимания содержания.
- Какое разрешение достаточно. Проверяется на наборе, обычно меньше исходного.
- Какова доля сложных случаев. От неё зависит, во что обойдётся поток.
- Куда уходят изображения. Документы с персональными данными — «152-ФЗ и нейросети».
Частые вопросы
Заменяет ли мультимодальная модель распознавание текста?
Не заменяет, а дополняет. Специализированное распознавание точнее в извлечении символов, особенно длинных номеров, и дешевле на однотипных документах. Модель лучше справляется со сложной вёрсткой, таблицами, рукописными пометками и фотографиями плохого качества.
Насколько дорого обрабатывать изображения?
Заметно дороже текста: одна страница в высоком разрешении может стоить как несколько страниц текста, и стоимость растёт с разрешением. Первое, что стоит проверить, — не отправляете ли вы изображения там, где есть извлекаемый текстовый слой, и не завышено ли разрешение.
Можно ли доверять числам, извлечённым из изображения?
Только с проверками. Модель может ошибиться в цифре, и ошибка будет молчаливой — результат выглядит правдоподобно. Контрольные суммы, сверка итога с суммой строк, сопоставление суммы прописью и цифрами обязательны.
Что лучше для звонков — мультимодальная модель или распознавание речи?
Для точной расшифровки — специализированное распознавание, затем разбор текста обычной моделью. Мультимодальная обработка звука оправдана в голосовых сценариях реального времени, где важна задержка, и там, где нужна интонация, а не только слова.
Как понять, нужна ли нам мультимодальная модель?
Посмотреть на состав входящих документов: есть ли текстовый слой, однотипны ли формы, много ли сложной вёрстки и фотографий от клиентов. Часто выясняется, что модель нужна для меньшей части потока, а остальное дешевле обработать проще.
Работают ли они с русским языком в документах?
Да, но качество стоит проверить на своих документах — особенно на рукописном тексте и на специфических формах. Как и в других задачах, общие утверждения о качестве заменяются проверкой на наборе из реальных случаев.
Что дальше
Извлечение текста из документов в целом — «OCR и PDF». Проверки извлечённых данных — «Извлечение данных из документов». Как считать стоимость — «Длина контекста и стоимость». Общие критерии выбора — «Выбор модели под задачу».
Проектирование обработки документов со смешанными типами входа — часть работы по разработке и внедрению ИИ.