Genie 3 от DeepMind: интерактивные миры из одной фразы
DeepMind показала Genie 3 — генеративную модель, которая строит управляемые 3D-миры по текстовому описанию и держит их в памяти. Разбираем, что она умеет, где ограничения и зачем это нужно кроме демо.
В августе 2025 года Google DeepMind представила Genie 3 — модель, которая по текстовому описанию генерирует интерактивный мир в реальном времени: не видеоролик, а среду, по которой можно ходить, поворачивать камеру и наблюдать, как сцена реагирует на действия. По заявлению DeepMind, Genie 3 держит разрешение 720p при 24 кадрах в секунду и сохраняет визуальную согласованность окружения на протяжении нескольких минут. Это шаг от «модель рисует красивую картинку» к «модель поддерживает мир, у которого есть память».
Звучит как игровой движок, но работает иначе. Никто не задаёт геометрию, физику и текстуры руками — всё это модель предсказывает на лету, кадр за кадром, реагируя на ввод пользователя. Именно этот сдвиг и делает Genie 3 интересным не только для геймдева.
Что такое world model и почему это не рендер
Genie 3 относится к классу world models — моделей мира1. Разница с обычным видеогенератором принципиальна. Видеомодель вроде Veo или Sora выдаёт готовый клип: вы задаёте промпт, получаете ролик, повлиять на него в процессе нельзя. World model генерирует следующий кадр с учётом того, что вы только что сделали — нажали «вперёд», повернули влево, кинули объект.
Три вещи, которые DeepMind вынесла в главные для Genie 3:
- Интерактивность в реальном времени. Мир отзывается на ввод с задержкой, приемлемой для управления, а не рендерится минутами.
- Согласованность во времени. Если вы отвернулись от объекта и вернулись, он с высокой вероятностью останется на месте — модель «помнит» сцену на горизонте порядка минуты.
- Управляемые события. Через текст можно на ходу менять мир: добавить дождь, поместить в сцену персонажа, поменять погоду или окружение.
Ценность не в том, что модель рисует лес. А в том, что по этому лесу можно идти, и деревья не исчезают за спиной.
Genie 3 против предшественников
Первый Genie (Genie 1) в 2024 году работал с 2D-платформерами и низким разрешением. Genie 2 в конце 2024-го перешёл к 3D-средам, но удерживал согласованность лишь короткие отрезки. Genie 3 — заметный скачок именно по длительности и разрешению. Точные метрики DeepMind раскрывает частично, поэтому цифры ниже стоит воспринимать как заявленные компанией ориентиры, а не как независимо проверенный бенчмарк.
| Версия | Год | Среда | Согласованность |
|---|---|---|---|
| Genie 1 | 2024 | 2D-платформеры | короткие эпизоды |
| Genie 2 | 2024 | 3D-миры | секунды |
| Genie 3 | 2025 | 3D, 720p / 24 fps | несколько минут |
Что значит «несколько минут»
Для человека минута удержания сцены — мало. Для генеративной world model это много: модель должна запоминать состояние объектов и возвращать их без «галлюцинаций». Чем длиннее горизонт согласованности, тем ближе среда к тому, чтобы в ней можно было обучать других агентов, а не просто показывать демо.
Зачем это нужно, кроме эффектных роликов
Главный практический адресат Genie 3 — не игроки, а обучение ИИ-агентов. DeepMind прямо позиционирует такие среды как тренировочные полигоны: агент действует внутри сгенерированного мира, получает обратную связь и учится, при этом мир можно бесконечно варьировать без ручной сборки уровней.
Где это может выстрелить:
- Робототехника и embodied AI. Агенту нужно много разнообразных сценариев для тренировки навигации и взаимодействия. Генерация сред дешевле, чем ручное моделирование.
- Прототипирование окружений. Дизайнер описывает сцену словами и сразу ходит по ней, вместо того чтобы собирать её в редакторе.
- Исследование самих world models. Genie — ступень к системам, которые моделируют не картинку, а поведение мира; это то же направление, что и разговоры про AGI.
Ограничения, о которых стоит помнить
Genie 3 — исследовательский превью, а не продукт. На момент анонса это не публичный сервис с подпиской и открытым доступом: DeepMind описывает его как экспериментальную модель с ограниченным доступом. Практические ограничения, которые называет сама команда и на которые указывают наблюдатели:
- Горизонт памяти всё ещё короткий. Минуты — не часы; для длинных задач согласованности не хватает.
- Точный контроль над действиями персонажей ограничен. Управлять миром проще, чем задавать сложное поведение конкретных агентов.
- Текст внутри сцен и мелкая детализация нестабильны — типичная слабость генеративных моделей.
- Нет публичных цен и SLA. Стоимость доступа, лимиты и условия использования на дату публикации не объявлены — их стоит смотреть в официальных анонсах DeepMind, а не выводить по аналогии с другими продуктами.
Как это соотносится с игровыми движками
Заменит ли Genie условный Unreal Engine? В обозримой перспективе — нет. Движок даёт детерминированность, контроль и производительность, а генеративный мир даёт разнообразие и скорость создания. Это разные инструменты под разные задачи, и вероятнее гибридные сценарии, а не вытеснение.
1 World model (модель мира) — нейросеть, которая учится предсказывать, как изменится окружение в ответ на действия, и генерирует следующее состояние среды. В отличие от видеогенератора, она поддерживает интерактивность: следующий кадр зависит от ввода пользователя или агента.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Google DeepMind — Genie 3 (официальный анонс), Google DeepMind — исследования и блог
Частые вопросы
Можно ли уже попробовать Genie 3 самому?
Чем Genie 3 отличается от Sora или Veo?
Сколько стоит доступ?
Заменит ли это игровые движки вроде Unreal или Unity?
Зачем вообще нужны такие сгенерированные миры?
Насколько долго Genie 3 удерживает мир согласованным?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.