1. Главная
  2. Docs
  3. Глоссарий
  4. Мультимодальность

Мультимодальность

9

Мультимодальность — способность одной модели работать с несколькими типами данных: принимать и порождать текст, изображения, аудио в любом сочетании. Практическая роль: входом в ИИ-систему становится не только текст, но и скриншот, фото документа, голосовое сообщение — без сборки конвейера из отдельных распознавателей.

Что значит «мультимодальная модель»

Одна модель — несколько типов данных. Текст, изображение и аудио обрабатываются общими весами: пользователь присылает фотографию и спрашивает о ней текстом, модель отвечает, ссылаясь на детали изображения. Альтернатива — конвейер из отдельных систем: сначала распознаватель переводит картинку в текст, затем текстовая модель его обрабатывает. У конвейера каждая стыковка теряет информацию; мультимодальная модель работает с исходным входом целиком.

Модальности на входе и на выходе. Практически сильнее всего сочетания: изображение на входе и текст на выходе — описание фото, чтение документов, ответы по скриншоту; аудио на входе и текст на выходе — голосовое управление; текст на входе и изображение на выходе — генерация картинок. Сочетания независимы: модель, читающая изображения, не обязана уметь их рисовать.

Как устроено: кодировщики и общее пространство

Каждой модальности — свой кодировщик. Изображение разбивается на фрагменты, каждый превращается в вектор; аудио нарезается на отрезки и кодируется аналогично. Дальше все векторы — и текстовые, и зрительные, и звуковые — поступают в общую модель как единая последовательность: своя «валюта» у кодировщиков, общая — у основной модели, обычно трансформера (о его механике — статья «Трансформер»).

Обучение связывает пространства. Модель учится ставить в соответствие изображение и его описание, звук и его расшифровку, вопрос по картинке и ответ. После обучения связка работает в обе стороны: можно спросить про картинку, можно потребовать картинку по описанию.

Отдельный распознаватель не нужен. Голосовое сообщение кодируется и понимается той же моделью, которая отвечает, — стык «сначала расшифруем, потом поймём» исчезает вместе с его ошибками.

Что это даёт на практике

Скриншот или фото как вход. Пользователь присылает скриншот ошибки — модель читает его и отвечает по существу, без перепечатывания текста вручную. Для техподдержки и клиентского сервиса это закрывает половину обращений, которые раньше требовали объяснений «что у вас написано на экране».

Документы: разовые случаи против потока. Фото счёта или акта можно отдать мультимодальной модели напрямую — она прочитает и текст, и структуру страницы. Для массового однородного потока документов отдельный OCR-конвейер обычно дешевле и стабильнее; граница применения и метрики — в статье «Распознавание документов (OCR)».

Голосовой ввод без отдельного распознавателя. Аудио входит в модель наравне с текстом: меньше потерь на стыке, лучше работа с неоднозначностью — модель слышит термин в контексте разговора, а не как изолированный звук. Как устроен классический путь через распознавание речи — в одноимённой статье «Распознавание речи».

Чего ждать не стоит

Модель «видит» иначе человека. Она не строит пространственную сцену: точное позиционирование объектов, подсчёт множества однотипных предметов, чтение мелкого текста и плотных таблиц — слабые места, ошибки здесь чаще, чем у человека. График без подписей осей читается с домыслами.

Уверенные галлюцинации на изображениях. На размытой фотографии модель может «прочитать» правдоподобный текст, которого на снимке нет. Критичные поля — суммы, реквизиты, номера — сверяются, случаи с низкой уверенностью уходят человеку.

Замена специализированных систем не гарантирована. Массовый поток однотипных документов или телефония с жёсткими требованиями к точности — территория специализированных конвейеров. Мультимодальная модель сильна на длинном хвосте разнообразных входов, где конвейер не настроить.

Где уместно и когда нужно

Типовые сценарии. Поддержка, где обращения приходят со скриншотами; боты в мессенджерах, принимающие голосовые; оценка повреждений по фото, товарные чеки, показания приборов; внутренние помощники, работающие со слайдами и схемами.

Как проверить. Собрать 50–100 реальных входов именно вашего потока и сравнить мультимодальную модель с текущим решением по точности и цене за случай. Демонстрация на удачных примерах не считается: распределение ошибок у мультимодальных входов шире, чем у текстовых.

Типичные ошибки

  • Изображение вместо текстового интерфейса. Если данные приходят из системы в структурированном виде, рендерить их в картинку для модели — платить больше и добавлять ошибки распознавания. Мультимодальность для входов, которых в текстовом виде нет.
  • Ожидание точного чтения сложных таблиц со скрина. Многоуровневые шапки и объединённые ячейки теряются; для учётных полей нужен контроль сверки или отдельный конвейер.
  • Игнор конфиденциальности. Фото экрана и документы содержат персональные данные и коммерческую тайну; входы проходят по той же политике, что и текст, включая обезличивание и разграничение доступа.
  • Выбор по демонстрации. Один удачно распознанный чек не говорит о надёжности; решение принимается по выборке реальных входов с посчитанной точностью.
  • Голос без страховки на критичных командах. Даже сильные модели ошибаются на шумных записях, именах и терминах; команды, меняющие данные, подтверждаются явно или текстом.

Частые вопросы

Мультимодальная модель — это несколько моделей в одной обёртке?

Часто это система: отдельные кодировщики для каждой модальности и общая модель над ними. Суть не в упаковке, а в общем пространстве и обученных связях между модальностями — пользователь видит одно целое, ошибки стыков внутри не видны снаружи.

Что лучше: мультимодальная модель или OCR плюс текстовая?

Разовые и разнообразные входы — модель: она понимает вёрстку и контекст. Массовый однородный поток документов — конвейер: дешевле за страницу, предсказуемее по ошибкам. Рабочий вариант — гибрид: конвейер на поток, модель на хвост и сложные случаи.

Может ли модель смотреть видео?

Да, покадрово или по выборке кадров: длинное видео обрабатывается фрагментами, детали между взятыми кадрами теряются. Для задач «найти момент, когда произошло событие» качество зависит от плотности выборки кадров.

Насколько точно читается мелкий текст с фото?

Зависит от качества съёмки: резкость, освещение и разрешение влияют сильнее, чем возможности модели. Для реквизитов и сумм вводится контроль — сверка по порогу уверенности или человеком; точность проверяется на своей выборке снимков.

Голосовой ввод через одну модель точнее конвейера?

На неоднозначной речи — как правило, да: контекст разговора помогает разобрать термин, который изолированный распознаватель исказил бы. На чистой записи разница мала, а ошибки остаются в обоих случаях — калибровка на своих записях обязательна.

Чем генерация изображений связана с мультимодальностью?

Это её обратная сторона: текст кодируется и ведёт генерацию изображения в общем пространстве. Как устроены генераторы — в статье о диффузионных моделях; для потребителя важно, что генерация и понимание картинок — разные способности одной модели или разных моделей.

Что почитать по теме