On-device агенты против облачных: где считать ИИ
Apple Intelligence, Gemini Nano и Phi-3 переносят часть работы ИИ прямо на телефон. Разбираем, что реально работает на устройстве, а что всё ещё требует облака — и сколько это стоит в скорости, деньгах и приватности.

Apple Intelligence на iPhone 15 Pro суммирует уведомления без единого запроса в сеть. Google запустил Gemini Nano прямо в Chrome через Prompt API. Microsoft держит модель Phi-3-mini на 3,8 млрд параметров, которая помещается в память телефона. Одновременно ChatGPT, Claude и полноценный Gemini живут в дата-центрах и обращаются к вашему устройству только за экраном. Граница между тем, что считается на процессоре у вас в кармане, и тем, что уходит на чужие серверы, — это не абстракция. Это разница в задержке, счёте за токены и в том, кто видит ваши данные.
Что вообще значит «агент на устройстве»
On-device агент — это языковая модель, которая запускается локально: на нейропроцессоре (NPU), GPU или CPU вашего телефона или ноутбука. Ничего не уходит в сеть, ответ формируется из весов, которые уже лежат в памяти. Облачный агент отправляет ваш запрос на сервер провайдера, где крутится модель на сотни миллиардов параметров, и возвращает результат.
Разница в масштабе колоссальная. Локальные модели сегодня — это 1–8 млрд параметров, урезанные и квантованные под мобильное железо. Облачные флагманы вроде GPT-4-класса или Claude — это модели, которые физически не влезут в память смартфона и потребуют киловатт энергии на инференс.
Термин, который стоит запомнить
Квантование* — это сжатие модели за счёт понижения точности весов: вместо 16-битных чисел используют 8-битные или 4-битные. Модель занимает в разы меньше памяти и считается быстрее ценой небольшой потери качества. Именно квантование делает возможным запуск ИИ на телефоне.
* Квантование (quantization) — метод оптимизации нейросети, при котором веса и активации переводят в формат меньшей разрядности (INT8, INT4) для экономии памяти и ускорения вычислений.
Где что выигрывает
У локального и облачного подхода почти нет пересечения по сильным сторонам. Они закрывают разные задачи, и попытка сделать всё на одном полюсе почти всегда упирается либо в качество, либо в стоимость.
| Критерий | On-device | Облако |
|---|---|---|
| Задержка | Десятки миллисекунд, нет сети | Зависит от сети и очереди на сервере |
| Приватность | Данные не покидают устройство | Запрос уходит провайдеру |
| Работа офлайн | Да | Нет |
| Качество на сложных задачах | Ограничено размером модели | Максимальное из доступного |
| Стоимость на запрос | Ноль после установки | Оплата за токены или подписка |
| Расход батареи и нагрев | Заметный при долгой работе | На стороне сервера |
| Обновление модели | Через апдейт приложения или ОС | Мгновенно у провайдера |
Локальная модель отвечает бесплатно и мгновенно на то, что умеет. Облачная умеет почти всё, но за каждый запрос вы платите деньгами, задержкой или данными.
Что реально работает на устройстве сегодня
Не стоит ждать от локального агента разбора 200-страничного договора или генерации кода целого сервиса. Мобильные модели хороши на коротких, шаблонных задачах, где важна скорость и не нужна энциклопедическая эрудиция.
- Суммаризация уведомлений и коротких текстов;
- Автодополнение и переписывание в тоне (formal/casual);
- Распознавание и перевод речи в реальном времени;
- Классификация и разметка входящих сообщений;
- Простые ответы-подсказки и извлечение сущностей (даты, суммы, имена).
Для тяжёлых сценариев — рассуждение по цепочке, работа с большим контекстом, генерация длинного кода, анализ изображений с деталями — облако пока вне конкуренции. Разрыв в качестве между 3-миллиардной локальной моделью и флагманом на серверах остаётся принципиальным, а не косметическим.
Гибрид как рабочая архитектура
На практике продакшн-решения всё чаще делают маршрутизацию. Простой запрос обрабатывается локально, сложный — отправляется в облако. Apple Intelligence публично описывает именно такую схему: часть задач решается на устройстве, часть уходит в Private Cloud Compute, и только с явным разрешением — во внешние модели.
Если вы строите собственный продукт, схема выбора обычно такая:
- Оцените запрос по длине и сложности прямо на устройстве дешёвым классификатором;
- Короткое и приватное — считайте локально;
- Сложное или требующее свежих данных — маршрутизируйте в облако;
- Логируйте долю локальных ответов: чем она выше, тем ниже счёт за API;
- Дайте пользователю переключатель приватности, чтобы он мог запретить отправку в облако вручную.
Цена вопроса в деньгах
Облачный инференс тарифицируется по токенам, и цены у провайдеров меняются постоянно — актуальные ставки смотрите в прайсах OpenAI, Anthropic и Google, а не в статьях. Порядок такой: чем мощнее модель, тем дороже тысяча токенов, и при активном использовании месячный счёт легко перерастает стоимость флагманского телефона с хорошим NPU.
Локальная модель после установки не стоит ничего за запрос. Но у неё своя цена: место в памяти (единицы гигабайт), расход батареи и нагрев при длительной работе, а также разработка и тестирование под разное железо. Для приложения с миллионами пользователей перенос части нагрузки на устройства — это прямая экономия на серверах. Для разового пет-проекта проще заплатить за API и не возиться с квантованием.
Что выбрать под вашу задачу
Ответ зависит от трёх вещей: насколько чувствительны данные, нужен ли офлайн и какого качества ответа вы ждёте.
- Приватные данные, простые задачи, офлайн — локально. Медицинские заметки, личные сообщения, работа в самолёте.
- Сложное рассуждение, свежая информация, редкие запросы — облако. Аналитика, длинные документы, генерация кода.
- Массовый продукт с миллионами запросов — гибрид с маршрутизацией, чтобы не разориться на API.
Ключевая ошибка — считать, что on-device скоро вытеснит облако. Обе стороны растут: телефонные NPU становятся мощнее, но и облачные модели не стоят на месте. Разрыв в масштабе сохранится, а значит, сохранится и разделение ролей.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Apple Intelligence and Private Cloud Compute — Apple Security Research, Gemini Nano and the Chrome Prompt API — Google for Developers
Частые вопросы
Может ли локальная модель полностью заменить ChatGPT?
Насколько локальный ИИ безопаснее для приватности?
Какое железо нужно, чтобы запускать агента на устройстве?
Сильно ли локальный ИИ сажает батарею?
Что дешевле для бизнеса — облако или свои модели на устройствах?
Сколько стоит облачный инференс?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.