1. Главная
  2. Блог
  3. Как маленькие языковые модели превращают смартфон в автономного AI-агента

Как маленькие языковые модели превращают смартфон в автономного AI-агента

22 июля 2026
120

Большие языковые модели обычно работают в облаке. Пользователь отправляет запрос на удалённый сервер, модель обрабатывает его и возвращает результат. Такой подход позволяет использовать мощные нейросети, но создаёт зависимость от интернета, серверной инфраструктуры и внешних сервисов.

Параллельно развивается другое направление — локальный искусственный интеллект, работающий непосредственно на смартфоне, планшете или компьютере пользователя.

Компактные языковые модели уже способны распознавать команды, выбирать функции приложения, обрабатывать текст, расшифровывать речь и управлять отдельными инструментами. При правильном дообучении даже модель размером в несколько сотен миллионов параметров может выполнять узкую задачу с точностью более 90%.

Разберёмся, что такое Tiny LLM, зачем запускать ИИ на устройстве и почему маленькая специализированная модель иногда оказывается полезнее универсальной облачной нейросети.

Что такое Tiny LLM

Tiny LLM — это компактная языковая модель, размер которой обычно не превышает одного миллиарда параметров. Некоторые модели этого класса содержат всего 100–500 миллионов параметров.

Для сравнения: крупные облачные модели могут состоять из миллиардов или десятков миллиардов параметров. Они способны поддерживать диалог, анализировать документы, писать программный код и решать широкий круг задач.

Маленькие модели устроены иначе. Их основное преимущество заключается не в универсальности, а в специализации.

Tiny LLM можно обучить:

  • распознавать намерение пользователя;
  • выбирать нужную функцию приложения;
  • преобразовывать текстовую команду в структурированный запрос;
  • исправлять результат расшифровки речи;
  • классифицировать сообщения;
  • извлекать даты, имена и другие данные;
  • управлять ограниченным набором инструментов;
  • выполнять простые агентные сценарии.

Чем меньше модель, тем более конкретной должна быть её задача. Не стоит ожидать, что компактная нейросеть станет полноценной заменой мощной облачной LLM. Зато она может быстро и стабильно выполнять одну функцию непосредственно на устройстве.

Зачем запускать искусственный интеллект на смартфоне

Локальная обработка имеет несколько важных преимуществ.

Конфиденциальность

Запросы и пользовательские данные могут оставаться на устройстве. Их не требуется отправлять на внешний сервер.

Это особенно важно при работе с:

  • личными сообщениями;
  • медицинскими данными;
  • корпоративной информацией;
  • аудиозаписями;
  • внутренними документами;
  • персональными словарями и контактами.

Работа без интернета

Локальная модель продолжает работать в самолёте, в дороге, в помещениях с плохой связью и при временной недоступности серверов.

Быстрый ответ

Приложению не нужно передавать информацию по сети и ожидать ответа облачного сервиса. Для некоторых задач результат может появляться практически мгновенно.

Снижение расходов

Каждый запрос к облачной модели требует вычислительных ресурсов. Если приложением пользуются тысячи или миллионы людей, расходы на API могут стать значительными.

При локальной обработке основная вычислительная нагрузка переносится на устройство пользователя.

Надёжность

Работа функции не зависит от загруженности сервера, качества соединения и доступности внешнего поставщика AI-сервисов.

Именно приватность, автономность, низкая задержка, надёжность и экономия считаются главными причинами развития on-device AI — искусственного интеллекта, работающего на пользовательском устройстве.

Как может быть устроен ИИ в мобильном приложении

Разработчику необязательно выбирать между локальной и облачной моделью. Современное приложение может использовать сразу несколько уровней искусственного интеллекта.

Системный ИИ

Некоторые AI-возможности уже встроены в операционную систему.

На Android приложения могут обращаться к системной модели через AI Core. В этом случае разработчику не нужно добавлять большую модель в установочный файл приложения.

Системный подход удобен, когда требуется стандартная функция, например:

  • краткое изложение текста;
  • базовая генерация;
  • классификация;
  • обработка поддерживаемого системой контента.

Главное преимущество состоит в том, что модель уже установлена и оптимизирована производителем устройства.

Модель внутри приложения

Если разработчику необходима уникальная логика, он может встроить собственную компактную модель.

Такой вариант даёт больше свободы:

  • можно выбрать архитектуру;
  • дообучить модель на собственных примерах;
  • добавить профессиональную терминологию;
  • настроить формат ответа;
  • ограничить набор доступных действий;
  • адаптировать модель под конкретный продукт.

Однако потребуется самостоятельно заниматься её оптимизацией, тестированием и интеграцией.

Облачная модель

Сложные задачи по-прежнему целесообразно передавать более мощной облачной системе.

Например:

  • анализировать большие документы;
  • создавать длинные статьи;
  • выполнять сложные рассуждения;
  • работать с неизвестными заранее темами;
  • планировать длинную цепочку действий.

На практике наиболее эффективным может оказаться гибридный подход. Простые и конфиденциальные операции выполняются локально, а сложные запросы отправляются в облако.

Что такое локальный AI-агент

Обычный чат-бот в основном создаёт текст. AI-агент способен не только отвечать, но и выполнять действия с помощью доступных ему инструментов.

Например, мобильный агент может:

  • найти объект на карте;
  • показать список ресторанов;
  • создать событие в календаре;
  • подготовить письмо;
  • открыть нужный раздел приложения;
  • обработать аудиозапись;
  • запустить поиск;
  • сохранить данные.

Для этого агенту передаётся описание доступных навыков или функций.

Предположим, пользователь пишет:

Покажи на карте ближайший офис компании.

Модель должна понять, что для выполнения запроса потребуется навигационный инструмент. Затем она загружает описание нужного навыка, получает необходимые параметры и вызывает соответствующую функцию.

Полные инструкции для каждого инструмента необязательно передавать модели заранее. Сначала можно предоставить только короткий список навыков, а подробности загружать по мере необходимости.

Такой подход уменьшает объём контекста и упрощает выбор подходящей функции.

В демонстрационной системе описание навыков добавляется в системную инструкцию, а подробная информация загружается только после выбора нужного инструмента. Результат может отображаться прямо в приложении, в том числе с помощью интерактивного интерфейса на JavaScript.

Google AI Edge Gallery для тестирования моделей

Одним из примеров приложения для экспериментов с локальным искусственным интеллектом является Google AI Edge Gallery.

Оно позволяет запускать модели непосредственно на мобильном устройстве и проверять разные сценарии:

  • AI-чат;
  • анализ изображений;
  • расшифровку аудио;
  • агентные навыки;
  • вызов функций;
  • модели сторонних разработчиков.

Если смартфон поддерживает системный AI Core, приложение может использовать уже доступную на устройстве модель. Также разработчик может загрузить собственную модель и проверить, как она работает на реальном оборудовании.

Android-версия приложения имеет открытый исходный код. Поэтому проект можно использовать не только для демонстрации, но и как пример интеграции локальной модели в собственное мобильное приложение.

Почему промпта недостаточно для маленькой модели

При работе с большой облачной LLM разработчик часто может просто описать задачу в системной инструкции.

Например:

Когда пользователь просит создать встречу, вызови функцию календаря и передай дату, время и название события.

Мощная модель обычно понимает такую инструкцию и может применить её к разным формулировкам.

Компактная модель хуже справляется с новыми правилами, переданными только через промпт. Ей сложнее:

  • различать похожие функции;
  • соблюдать строгий формат ответа;
  • правильно извлекать аргументы;
  • учитывать длинную инструкцию;
  • обрабатывать нестандартные запросы;
  • понимать опечатки и разговорные выражения.

Поэтому Tiny LLM часто необходимо дополнительно обучать на примерах конкретной задачи.

Этот процесс называется fine-tuning, или дообучение модели.

Как fine-tuning повысил точность с 46% до 90%

Один из наиболее интересных примеров связан с вызовом функций внутри мобильного приложения.

Модель должна была работать примерно с десятью действиями. Например:

  • создать событие;
  • подготовить письмо;
  • выбрать функцию приложения;
  • извлечь нужные параметры из команды пользователя.

Без специального дообучения модель успешно выполняла приблизительно 46% тестовых запросов.

Это означает, что более чем в половине случаев она могла:

  • выбрать неправильную функцию;
  • перепутать аргументы;
  • сформировать неверный формат;
  • не понять команду пользователя.

После этого для модели подготовили специализированный набор данных.

В него включили:

  • разные варианты пользовательских команд;
  • правильные вызовы функций;
  • примеры разговорной речи;
  • разные форматы дат и времени;
  • похожие команды для разных инструментов;
  • сложные и пограничные случаи.

После дообучения точность превысила 90% для восьми из десяти функций. Две оставшиеся функции показывали более низкий результат и нуждались в дополнительной настройке.

Рост с 46% до более чем 90% показывает, насколько сильно качество небольшой модели зависит от обучающих примеров.

Для Tiny LLM данные — это фактически часть программной логики.

Что такое синтетические данные

Подготовка тысяч обучающих примеров вручную требует много времени. Поэтому датасеты для небольших моделей часто создаются с помощью более мощной нейросети.

Такие данные называются синтетическими.

Предположим, разработчик хочет научить модель создавать события в календаре. Большая LLM может сгенерировать множество вариантов одной и той же команды:

  • «Добавь встречу с Анной завтра в 15:00».
  • «Запланируй разговор с Анной на три часа дня».
  • «Поставь в календарь созвон с Анной на завтра».
  • «Завтра после обеда у меня встреча с Анной».
  • «Создай событие на завтра, 15:00, название — встреча с Анной».

Для каждой фразы задаётся правильный структурированный результат.

Однако датасет должен включать не только идеальные команды. В реальной жизни пользователи допускают ошибки, не указывают часть информации и используют неоднозначные выражения.

Поэтому полезно добавлять:

  • опечатки;
  • неполные запросы;
  • лишние слова;
  • разговорные формулировки;
  • необычный порядок слов;
  • команды без точной даты;
  • запросы, для которых нельзя вызывать функцию;
  • похожие команды с разным значением.

Перед обучением синтетические данные необходимо проверять. Большая модель тоже может генерировать неправильные или слишком однообразные примеры.

Function Gemma для вызова функций

В качестве компактной специализированной модели в исходном материале рассматривается Function Gemma.

Её размер составляет около 270 миллионов параметров. Модель предназначена прежде всего для function calling — преобразования пользовательских команд в вызовы программных функций.

Например, пользователь пишет:

Напомни мне позвонить врачу завтра утром.

Модель должна сформировать не обычный текстовый ответ, а структурированную команду, которую сможет обработать приложение.

Условный результат может выглядеть так:

{
  "function": "create_reminder",
  "title": "Позвонить врачу",
  "date": "завтра",
  "time": "утро"
}

Главное требование к такой модели — не творческий ответ, а стабильность.

Она должна:

  • правильно определить намерение;
  • выбрать подходящий инструмент;
  • заполнить обязательные параметры;
  • соблюдать формат;
  • не вызывать функцию без необходимости.

Благодаря небольшому размеру модель может работать достаточно быстро даже на мобильных устройствах предыдущих поколений.

Как подготовить компактную модель для приложения

Процесс внедрения Tiny LLM можно разделить на несколько этапов.

1. Выбрать конкретную задачу

Необходимо заранее определить, что именно должна делать модель.

Плохая постановка:

Модель должна быть умным мобильным помощником.

Более подходящая постановка:

Модель должна выбирать одну из десяти функций приложения и извлекать из пользовательской команды необходимые аргументы.

Чем точнее определена задача, тем проще добиться стабильного результата.

2. Выбрать базовую модель

При выборе следует учитывать:

  • количество параметров;
  • поддерживаемые языки;
  • тип лицензии;
  • скорость работы;
  • возможность квантования;
  • поддержку мобильного оборудования;
  • качество на целевой задаче.

3. Создать датасет

Для каждой функции подготавливаются пользовательские команды и правильные ответы.

Важно разделить данные на обучающую и тестовую части. Нельзя оценивать модель только на тех примерах, которые она уже видела во время обучения.

4. Дообучить модель

Fine-tuning помогает закрепить нужное поведение непосредственно в параметрах модели.

5. Выполнить квантование

Квантование уменьшает размер модели и требования к памяти.

Вместо чисел высокой точности используются более компактные представления. Это ускоряет работу, хотя иногда может немного снизить качество.

6. Экспортировать модель

После обучения модель преобразуется в формат, поддерживаемый мобильным рантаймом.

В экосистеме Google для этого используется LiteRT-LM — инструмент для запуска языковых моделей на разных устройствах. Он позволяет использовать CPU, GPU или NPU в зависимости от возможностей платформы.

7. Проверить модель на смартфоне

Тестирование на компьютере недостаточно. На реальном устройстве необходимо измерить:

  • скорость первого ответа;
  • скорость обработки текста;
  • потребление оперативной памяти;
  • размер модели;
  • нагрев устройства;
  • расход батареи;
  • стабильность;
  • точность на реальных пользовательских запросах.

Маленькие модели могут работать вместе

Для создания полезного AI-продукта необязательно использовать одну универсальную модель.

Можно объединить несколько компактных компонентов в последовательную систему.

Примером является сервис расшифровки речи:

  1. Первая модель преобразует аудио в текст.
  2. Вторая исправляет ошибки.
  3. Персональный словарь помогает распознавать имена и специальные термины.
  4. Дополнительная обработка удаляет слова-паразиты и лишние паузы.
  5. Пользователь получает аккуратно оформленный текст.

Каждая модель выполняет только свою функцию. В результате несколько маленьких компонентов создают полноценный сервис, способный работать автономно.

В рассматриваемом примере модели распознавания и обработки текста имеют размер всего в несколько сотен миллионов параметров, но вместе обеспечивают качественную локальную расшифровку с персонализацией.

Где можно применять Tiny LLM

Компактные локальные модели подходят для большого количества практических задач.

Голосовые помощники

Модель распознаёт команду и выбирает действие без отправки аудио в облако.

Медицинские приложения

Локальная обработка помогает работать с конфиденциальными данными и профессиональной терминологией.

Корпоративные системы

Модель может классифицировать обращения, заполнять формы и управлять внутренними функциями приложения.

Расшифровка аудио

Пользователь получает текст даже без подключения к интернету.

Календарь и напоминания

Модель преобразует обычную фразу в структурированное событие.

Работа с документами

Небольшая модель может извлекать даты, номера, имена и другие заранее определённые данные.

Персональные словари

Локальный ИИ может учитывать имена сотрудников, названия проектов, медицинские термины и профессиональные сокращения.

Управление приложением

Вместо ручного перехода по меню пользователь формулирует команду естественным языком.

Ограничения локальных AI-агентов

Несмотря на развитие технологии, небольшие модели пока не решают все задачи.

Сложные цепочки действий

Модель может уверенно выбрать один навык или последовательно использовать инструменты в рамках диалога.

Гораздо сложнее выполнить несколько действий по одному запросу.

Например:

Найди ресторан рядом с офисом, выбери лучший вариант, забронируй столик и добавь событие в календарь.

Для этого агенту необходимо правильно спланировать последовательность действий, передать результаты между инструментами и обработать возможные ошибки.

В представленном эксперименте модель достаточно хорошо выбирала один из примерно восьми навыков. Последовательное применение разных инструментов в диалоге также работало стабильно. Но вызов нескольких навыков в рамках одного ответа всё ещё требовал улучшения.

Ограниченный контекст

Маленькая модель хуже удерживает длинную историю разговора и большое количество инструкций.

Узкая специализация

Модель, обученная управлять календарём, не сможет качественно анализировать юридический договор или писать большую аналитическую статью.

Разные устройства

Скорость и стабильность зависят от процессора, количества памяти и наличия нейронного ускорителя.

Размер приложения

Даже компактная модель может занимать сотни мегабайт. Иногда её лучше загружать отдельно после установки приложения.

Когда локальная модель действительно выгодна

Tiny LLM имеет смысл использовать, если:

  • задача ограничена и хорошо описана;
  • модель часто выполняет однотипные операции;
  • данные желательно не передавать в облако;
  • требуется работа без интернета;
  • важен быстрый ответ;
  • существует возможность создать качественный датасет;
  • результат можно проверить программным способом;
  • облачные запросы создают значительные расходы.

Если же приложение должно свободно отвечать на любые вопросы, создавать длинные материалы и выполнять сложные рассуждения, лучше использовать крупную системную или облачную модель.

Безопасность AI-агентов

Высокая точность не означает, что модель никогда не ошибается.

Даже при результате более 90% остаётся вероятность неправильного вызова функции. Поэтому AI-агент не должен напрямую выполнять критические действия без проверки.

Перед отправкой письма, удалением файла, изменением календаря или совершением платежа приложение должно:

  • проверить формат ответа;
  • проверить допустимость аргументов;
  • показать пользователю подготовленное действие;
  • запросить подтверждение;
  • предоставить возможность отмены;
  • вести журнал операций.

Модель следует рассматривать как вероятностный компонент, а не как полностью надёжную бизнес-логику.

Почему маленькие модели могут изменить рынок приложений

Локальные модели дают разработчикам возможность добавлять AI-функции без постоянной оплаты облачных вычислений.

Это особенно важно для массовых продуктов. Если одна функция вызывается миллионы раз, стоимость серверной обработки может оказаться очень высокой.

При использовании локальной модели основные затраты возникают на этапе разработки:

  • подготовка данных;
  • fine-tuning;
  • оптимизация;
  • тестирование;
  • интеграция.

После выпуска приложения вычисления выполняются преимущественно на устройстве пользователя.

Таким образом, Tiny LLM может быть не только техническим, но и экономическим решением.