Veo 3.1: как «ингредиенты» дают контроль над видео
Google обновил генератор видео Veo до версии 3.1: режим Ingredients to Video позволяет собрать сцену из нескольких референсов и удержать один персонаж или объект в кадре. Разбираем, что реально изменилось.

Google выкатил Veo 3.1 — обновление своей модели генерации видео, доступной через приложение Flow, Gemini API и Vertex AI. Главное нововведение — режим Ingredients to Video: вы загружаете несколько изображений-референсов (персонажа, предмет, фон), а модель собирает из них связную сцену и держит эти элементы стабильными от кадра к кадру. Плюс к этому — синхронный звук, более длинные ролики и точечное редактирование внутри сгенерированного видео.
Что такое «ингредиенты» и зачем они нужны
Главная боль всех генераторов видео — консистентность. Просите модель показать одного и того же человека в двух сценах — и получаете двух разных людей: меняется лицо, одежда, цвет волос. Для рекламного ролика или короткого фильма это убивает всю затею.
Ingredients to Video решает задачу иначе, чем текстовый промпт. Вы передаёте модели набор картинок — «ингредиентов»:
- изображение персонажа, которого нужно сохранить в кадре;
- предмет — например, конкретную бутылку, сумку или гаджет;
- референс стиля или окружения — интерьер, палитра, атмосфера.
Модель использует их как визуальный якорь. В результате один и тот же герой узнаваем в разных сценах, а продукт выглядит так, как на вашем фото, а не как его приблизительная фантазия нейросети.
Текст описывает, что происходит. «Ингредиенты» описывают, кто и что при этом должно оставаться неизменным. Это разные оси контроля, и раньше второй почти не было.
Что нового в 3.1 по сравнению с прошлой версией
Google называет три направления улучшений: консистентность, креативность и контроль. Если убрать маркетинговую обёртку, речь о нескольких конкретных возможностях.
Звук из коробки
Veo 3 научился генерировать видео со синхронным звуком — диалогами, эффектами, фоновым аудио. В 3.1 это распространили и на сценарии, где раньше звука не было, включая переходы между сценами и режимы редактирования. То есть ролик выходит сразу озвученным, а не немой картинкой, к которой отдельно клеят аудиодорожку.
Редактирование готового ролика
Появились операции над уже сгенерированным видео. Ключевые:
- Добавление объекта — вставить элемент в существующую сцену, чтобы он выглядел естественно по свету и теням;
- Удаление объекта — убрать лишнее из кадра;
- Расширение сцены — достроить кадры до и после, продлив ролик.
Это сдвигает Veo от «сгенерировал и молись» ближе к монтажному инструменту, где отдельный дубль можно поправить, а не переснимать заново.
Управление первым и последним кадром
Можно задать стартовое и финальное изображение, а модель достроит плавный переход между ними. Удобно, когда нужно, чтобы ролик начинался и заканчивался конкретной картинкой — например, кадром с продуктом.
Где это доступно и сколько стоит
Veo 3.1 раскатывают по нескольким продуктам Google:
- Flow — веб-приложение Google для работы с видео, ориентированное на творческие сценарии;
- Gemini API — для разработчиков, кто встраивает генерацию в свои сервисы;
- Vertex AI — облачная платформа для корпоративных пользователей.
Цены на генерацию видео у Google считаются посекундно и зависят от модели и разрешения. Конкретные тарифы меняются, поэтому актуальные цифры сверяйте в прайсе Gemini API и Vertex AI, а не по устаревшим обзорам — за минуту роликов в высоком качестве набегает ощутимая сумма.
Как это выглядит на фоне конкурентов
Google не единственный, кто бьётся за консистентность и управляемость. Основные игроки на рынке генерации видео и их подходы к контролю:
| Продукт | Разработчик | Опорные точки контроля |
|---|---|---|
| Veo 3.1 | Референсы-«ингредиенты», первый/последний кадр, встроенный звук, редактирование сцены | |
| Sora | OpenAI | Текст, изображения, ремикс существующих роликов |
| Gen-3 / Gen-4 | Runway | Текст, изображения-референсы, инструменты движения камеры |
| Kling | Kuaishou | Текст, начальный/конечный кадр, референсы персонажа |
Функции у всех пересекаются, и таблица показывает направление, а не окончательный расклад: версии и наборы возможностей меняются каждые несколько месяцев. Сильная сторона Veo — связка референсов с синхронным звуком в одном пайплайне.
Кому это реально пригодится
Ingredients to Video закрывает узкую, но частую задачу — держать один и тот же персонаж или продукт в серии сцен. Сценарии, где это меняет дело:
- Реклама и товарные ролики. Загружаете фото своего продукта — и он выглядит одинаково во всех кадрах, а не как размытая интерпретация.
- Короткие истории. Один герой в нескольких сценах без «плавающего» лица между ними.
- Раскадровки и питчи. Быстро собрать черновой ролик из имеющихся картинок, чтобы показать идею заказчику до дорогого продакшена.
Чего ждать не стоит: полной кинематографической точности и гарантии, что модель не исказит детали. Мелкий текст, руки, симметрия сложных объектов по-прежнему проблемные зоны любых видеомоделей. «Ингредиенты» повышают шанс на консистентность, но не превращают её в стопроцентную.
Практический совет: относитесь к Ingredients to Video как к инструменту чернового и рекламного продакшена, а не как к замене съёмочной группе. Экономия времени на прототипах — реальная, но финальный контроль над каждым кадром остаётся ограниченным.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Google DeepMind — Veo, Gemini API — Video generation documentation
Частые вопросы
Чем Ingredients to Video отличается от обычного текстового промпта?
Сколько стоит генерация видео в Veo 3.1?
Можно ли редактировать уже сгенерированный ролик?
Гарантирует ли режим «ингредиентов» полную консистентность?
Где доступен Veo 3.1?
Есть ли у роликов звук?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.