Gemma 3n: как гонять мультимодальную модель на телефоне
Google выпустила Gemma 3n — семейство открытых моделей, которые работают на устройствах с 2 ГБ памяти и понимают текст, картинки, звук и видео. Разбираем, что это даёт разработчику и где подвох.

Google представила Gemma 3n — семейство открытых моделей, спроектированных под запуск прямо на устройстве: смартфоне, планшете, ноутбуке. Заявленная фишка — эффективная работа при небольшом объёме памяти и поддержка сразу четырёх типов входных данных: текста, изображений, аудио и видео. Для разработчика это означает возможность собрать мультимодальное приложение, которое не отправляет данные пользователя на сервер и не жжёт бюджет на облачные токены.
Что именно выпустили
Gemma 3n — это не одна модель, а линейка вариантов разного размера. Ключевая идея архитектуры — так называемые параметры эффективные и параметры общие: модель формально крупнее, но в память при инференсе загружается заметно меньшая её часть. Google маркирует версии не только по числу параметров, но и по объёму памяти, необходимому для запуска, — и это честнее, потому что именно память чаще всего упирается в потолок на мобильном железе.
Официально заявлена работа на устройствах примерно от 2 ГБ доступной памяти для младшего варианта. Точные требования и размеры каждой версии лучше сверять в документации Google AI, потому что линейка обновляется, а цифры в анонсах и в actual-релизе иногда расходятся.
Главное отличие Gemma 3n от прошлых открытых моделей Google — не качество ответов, а то, что мультимодальность приехала на устройство, где раньше помещался только текст.
Мультимодальность на входе
Модель принимает текст, изображения и аудио, а также обрабатывает видео как последовательность кадров плюс звук. На выходе — текст. То есть это не генератор картинок и не синтезатор речи: Gemma 3n читает и слушает, но отвечает словами. Практические сценарии, которые из этого вырастают:
- описание фото и распознавание сцены без отправки снимка в облако;
- расшифровка и краткое содержание голосовой заметки офлайн;
- ответы на вопросы по содержимому короткого видео;
- ассистент в приложении, который видит скриншот экрана и подсказывает следующий шаг.
Зачем это разработчику
Экономика тут простее, чем кажется. Облачная мультимодальная модель считает деньги за каждый запрос и токен, а on-device модель после установки не стоит ничего за инференс — вы платите только батареей и временем пользователя. Для приложения с частыми обращениями к модели разница за месяц может быть кратной.
Второй мотив — приватность и офлайн. Данные не покидают устройство, а значит проще с согласиями пользователя и с работой без сети. Третий — задержка: локальный ответ приходит без круга до сервера и обратно.
Чем платить за локальность
Бесплатных обедов нет. On-device модель меньше топовых облачных, поэтому и точность на сложных задачах ниже. Первый запуск после загрузки в память может занимать заметное время. На слабых устройствах длинный контекст и обработка видео упираются в память и греют аппарат. Реалистичный подход — гибрид: простое и приватное считать локально, тяжёлое отправлять в облако.
Как попробовать
Порог входа Google старается держать низким. Веса выложены в открытый доступ, а запускать можно через несколько маршрутов в зависимости от того, где вы работаете.
- Быстрый прототип на своей машине — через популярные рантаймы для локальных моделей, куда Gemma 3n добавили в поддерживаемые.
- Мобильное приложение — через оптимизированный стек Google для инференса на устройстве.
- Дообучение под свою задачу — через стандартные библиотеки тонкой настройки, если базовое качество не устраивает.
- Оценка без установки — в облачной песочнице Google AI Studio, чтобы понять, тянет ли модель вашу задачу в принципе.
Конкретные имена пакетов, форматы весов и минимальные версии SDK берите из актуальной документации: они меняются от релиза к релизу, и захардкоженная в статье команда завтра может не сработать.
Где Gemma 3n в общей картине
Сравнивать её честно нужно не с флагманскими облачными моделями, а с тем, что реально работает на устройстве. Ниже — грубая карта выбора, без абсолютных цифр, потому что бенчмарки быстро устаревают.
| Задача | On-device Gemma 3n | Облачная топ-модель |
|---|---|---|
| Приватность данных | Данные не уходят с устройства | Отправка на сервер |
| Стоимость запроса | Ноль после установки | Плата за токены |
| Работа офлайн | Есть | Нет |
| Точность на сложных задачах | Ниже | Выше |
| Задержка ответа | Зависит от железа, без сетевого круга | Круг до сервера |
Про лицензию — читайте до интеграции
Gemma распространяется под собственными условиями использования Google, а не под классической OSI-лицензией вроде Apache 2.0. Это разрешительная лицензия, допускающая коммерческое применение, но с ограничениями по запрещённым сценариям использования*. Перед тем как встраивать модель в продукт, прочитайте текст условий целиком — особенно раздел о запрещённых применениях и об ответственности за дообученные версии.
* Разрешительная лицензия — та, что позволяет использовать, менять и распространять продукт, включая коммерческое использование, но может накладывать условия: указание авторства, запрет на отдельные сценарии, требование передавать те же условия дальше. Это не то же самое, что общественное достояние.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Google Developers Blog — Gemma 3n, Gemma — документация Google AI for Developers
Частые вопросы
Gemma 3n правда работает без интернета?
Можно ли использовать Gemma 3n в коммерческом продукте бесплатно?
Сколько памяти реально нужно для запуска?
Gemma 3n генерирует картинки и речь?
Стоит ли заменять облачную модель на Gemma 3n целиком?
Можно ли дообучить Gemma 3n под свою задачу?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.