Gemma 4 12B: единая мультимодальная модель без энкодера
Google представила Gemma 4 12B — открытую мультимодальную модель, которая обрабатывает текст и изображения без отдельного визуального энкодера. Разбираем, что это меняет для разработчиков.

Google выпустила Gemma 4 12B — открытую модель на 12 миллиардов параметров, которая объявлена как unified encoder-free multimodal. Ключевое отличие от предыдущих поколений: изображения и текст обрабатываются одним и тем же стеком слоёв, без отдельного визуального энкодера вроде CLIP или SigLIP, который раньше стоял на входе и превращал картинку в эмбеддинги. Для тех, кто строит приложения поверх открытых моделей, это меняет и архитектуру инференса, и требования к железу.
Что именно Google положила в веса, под какой лицензией их отдаёт и какие цифры по производительности подтверждены официально — часть деталей на момент публикации нужно сверять в карточке модели, потому что Google традиционно уточняет их постепенно. Ниже — то, что понятно из заявленной архитектуры, и то, о чём стоит спросить прежде, чем тащить модель в прод.
Что значит «encoder-free»
В классической мультимодальной схеме картинка проходит через отдельную нейросеть-энкодер, которая выдаёт набор токенов-эмбеддингов. Эти токены склеиваются с текстовыми и подаются в языковую модель. Схема работает, но у неё есть цена: два разных модуля, обученных по-разному, стык между ними и отдельный проектор, который приводит визуальные эмбеддинги к размерности языковой модели.
Encoder-free подход убирает промежуточное звено. Изображение разбивается на патчи и подаётся в общий трансформерный стек напрямую, как ещё одна последовательность токенов. Модель учится видеть и читать одними и теми же слоями.
Убрать энкодер — значит перестать держать в памяти и обслуживать две модели вместо одной. Для локального инференса на одной видеокарте это часто разница между «запускается» и «не влезает».
Плюсы для разработчика
- Один набор весов вместо связки «энкодер + LLM + проектор» — проще деплой и квантизация.
- Нет рассинхрона между модальностями на стыке: текст и картинка живут в одном пространстве представлений.
- Потенциально ниже задержка на первом проходе, потому что нет отдельного прогона через визуальный бэкенд.
Что придётся проверить самому
- Качество на узких визуальных задачах (OCR*, распознавание диаграмм, мелкий текст на скринах) у encoder-free моделей исторически бывает слабее, чем у моделей со специализированным энкодером. Тестируйте на своих данных.
- Разрешение входного изображения и то, как модель дробит его на патчи, — от этого зависит, разглядит ли она мелкие детали.
- Реальное потребление VRAM в вашем формате квантизации, а не цифру из пресс-релиза.
12B: куда эта модель метит
Размер в 12 миллиардов параметров — это сегмент, который целятся запускать на одной потребительской или полупрофессиональной видеокарте. В FP16 такая модель весит порядка двух десятков гигабайт, в 4-битной квантизации — заметно меньше, что открывает запуск на картах с 16 ГБ памяти. Точные цифры зависят от формата и рантайма, так что перед закупкой железа сверьтесь с бенчмарками сообщества, а не с округлёнными оценками.
По позиционированию это модель «для разработчиков, а не только для исследователей»: открытые веса, возможность дообучения под свою задачу, локальный запуск без отправки данных в облако. Последнее особенно важно там, где картинки нельзя гонять через сторонний API — медицина, документы, внутренние системы.
Сравнение подходов
| Параметр | Схема с энкодером | Encoder-free |
|---|---|---|
| Число обучаемых модулей | Энкодер + LLM + проектор | Единый стек |
| Сложность деплоя | Выше: два бэкенда | Ниже: одна модель |
| Тонкая работа с изображением | Обычно сильнее | Требует проверки |
| Память при инференсе | Больше за счёт энкодера | Потенциально меньше |
Лицензия и ограничения
Семейство Gemma распространяется под собственными условиями использования Gemma Terms of Use, а не под классической OSI-лицензией вроде Apache 2.0. Это значит, что «открытая» здесь — про доступ к весам и право дообучать, но с набором ограничений на запрещённые сценарии применения. Перед коммерческим внедрением прочитайте условия целиком: формулировки Google по каждому релизу могут отличаться, и именно они определяют, что вам можно, а что нет.
Как подступиться на практике
- Скачайте карточку модели с официального ресурса Google и сверьте заявленные бенчмарки, размер и поддерживаемые языки.
- Возьмите квантизованную версию под ваш объём VRAM и прогоните на своих реальных изображениях, а не на демо-картинках.
- Отдельно протестируйте узкие задачи: OCR, чтение таблиц, мелкий текст — именно там encoder-free модели чаще проседают.
- Сравните результат с текущей связкой (если она у вас есть) по качеству и по стоимости инференса в GPU-часах.
- Проверьте лицензионные ограничения под ваш сценарий до того, как выкатывать в продукт.
Главная интрига Gemma 4 12B не в размере, а в архитектурной ставке: Google утверждает, что единый стек без энкодера догоняет по качеству классическую схему, оставаясь проще в эксплуатации. Подтвердится ли это на ваших данных — вопрос, который решается только замером, а не чтением анонса.
* OCR (Optical Character Recognition) — распознавание текста на изображении: извлечение символов со скриншотов, сканов документов, фотографий.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Google Developers Blog — Gemma, Gemma Terms of Use
Частые вопросы
Чем encoder-free модель отличается от обычной мультимодальной?
На какой видеокарте запустится Gemma 4 12B?
Можно ли использовать Gemma 4 в коммерческом продукте?
Encoder-free подход хуже распознаёт текст на картинках?
Где взять официальные цифры производительности?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.