D4RT: как ИИ учат видеть мир в четырёх измерениях
Обычные модели компьютерного зрения работают с плоской картинкой. Подход D4RT добавляет к трём пространственным осям время — и это меняет то, как машина понимает движущуюся сцену.

Камера в беспилотнике видит не набор фотографий, а поток. Пешеход шагнул с бордюра, велосипедист вильнул, впереди тормозит фура — и всё это происходит одновременно и связно. Классические детекторы объектов вроде YOLO или трансформеры типа DETR разбирают каждый кадр по отдельности, а связывание объектов между кадрами навешивают сверху отдельным трекером. Подход, который в исследовательских работах обозначают как 4D-восприятие (иногда под рабочим именем D4RT — 4D Ray Transformer), пробует сделать иначе: рассматривать пространство и время как единое четырёхмерное поле и учить модель рассуждать сразу в нём.
Разберём, что стоит за идеей «четырёх измерений», где это уже применяют и почему это не маркетинговая обёртка над обычным видеоанализом.
Что значит «четвёртое измерение» для модели зрения
Три измерения здесь — привычные X, Y, Z: положение точки в пространстве. Четвёртое — время. Ключевое отличие 4D-подхода от покадровой обработки в том, что модель не склеивает готовые предсказания задним числом, а изначально держит в представлении, что одна и та же точка сцены существует в разные моменты и движется по траектории.
На практике сцена описывается как облако точек, растянутое во времени, или как поле лучей1, каждый из которых несёт информацию не только «что здесь», но и «куда это движется». Трансформер учится связывать наблюдения между временными срезами через механизм внимания — так же, как языковая модель связывает слова в предложении, только вместо токенов текста здесь токены пространства-времени.
Разница как между стопкой фотографий и видеозаписью: на фотографиях вы видите отдельные позы, на видео — само движение. 4D-модель с самого начала работает с движением, а не восстанавливает его постфактум.
Почему покадровый подход упирается в потолок
Детектировать объект на одном кадре модели научились хорошо. Проблемы начинаются, когда объектов много и они перекрывают друг друга. Человек зашёл за столб и вышел — покадровый трекер легко теряет его или путает с другим. Быстрое движение размывает границы. Датчик LiDAR2 в один момент видит спину пешехода, в следующий — бок, и связать эти проекции в один объект без понимания динамики трудно.
4D-представление даёт модели контекст: если точка двигалась с определённой скоростью и на долю секунды пропала из виду, её положение можно предсказать, а не терять. Это критично для автономного транспорта, где ошибка трекинга измеряется не в метрике качества, а в тормозном пути.
Где это уже работает
Четырёхмерное восприятие раньше всего пришло в области, где ставка высока, а данные изначально трёхмерны и потоковы:
- Автономное вождение. Данные с LiDAR и радаров — это облака точек в реальном времени. Модели предсказывают не только текущее положение других участников движения, но и их траектории на секунды вперёд.
- Робототехника. Манипулятору нужно понимать, как объект будет двигаться, пока рука до него дотягивается. Статичной картинки недостаточно.
- Медицинская визуализация. Сердце бьётся, лёгкие расширяются — 4D-КТ и 4D-УЗИ дают объём плюс время, и модели учатся отличать патологию от нормальной динамики.
- Спорт и биомеханика. Разбор движения тела в объёме и во времени для оценки техники и рисков травм.
Чем 4D-модель отличается от «видео плюс трекер»
| Аспект | Покадровый детектор + трекер | 4D-подход (пространство-время вместе) |
|---|---|---|
| Единица обработки | Отдельный кадр | Окно кадров как единое поле |
| Связь объектов во времени | Отдельный модуль поверх | Встроена в само представление |
| Поведение при перекрытии | Часто теряет объект | Достраивает траекторию |
| Предсказание движения | Требует отдельной модели | Заложено в архитектуру |
| Стоимость вычислений | Ниже на кадр | Выше: обрабатывается объём данных |
Главный компромисс виден в последней строке. Четыре измерения — это в разы больше данных на вход, а значит больше памяти и вычислений. Поэтому 4D-модели чаще запускают на специализированном железе или урезают временное окно, чтобы уложиться в бюджет реального времени.
Что мешает внедрению
Ограничений хватает, и о них честнее говорить прямо, чем обещать революцию.
- Данные. Размеченных 4D-датасетов мало. Разметить движущийся объект в объёме и во времени дороже, чем обвести коробкой на фото.
- Вычисления. Обработка пространственно-временного объёма требовательна к памяти. Для бортового компьютера в машине это жёсткое ограничение.
- Латентность. Модель должна выдавать результат за миллисекунды. Чем длиннее временное окно, тем труднее уложиться.
- Обобщение. Модель, обученная на городских улицах, необязательно поймёт сцену на трассе или в снегопаде.
Точные метрики качества и скорости зависят от конкретной реализации и датасета — сравнивать цифры из разных статей напрямую некорректно, потому что условия замеров различаются. Если встретите заявление «модель X точнее на столько-то процентов», проверьте, на каком бенчмарке и в каких условиях его получили.
Куда это движется
Тренд общий: модели зрения уходят от плоской картинки к пространственному и теперь пространственно-временному пониманию. Это часть более широкого поворота к так называемым world models — системам, которые не просто распознают, что на изображении, а строят внутреннюю модель того, как мир устроен и как он будет меняться. Четырёхмерное восприятие — один из кирпичей такой модели.
Для разработчиков практический вывод простой: если ваша задача связана с движением в объёме — транспорт, робот, медицинская динамика — стоит смотреть в сторону пространственно-временных архитектур, а не наращивать частоту кадров у плоского детектора. Для всех остальных задач, где сцена статична или движение вторично, покадровый подход остаётся дешевле и проще.
1 Поле лучей (ray field) — представление сцены как набора лучей из точки наблюдения, вдоль каждого из которых модель предсказывает, что находится в пространстве. Идея пришла из нейронного рендеринга (NeRF).
2 LiDAR — лазерный дальномер, который сканирует окружение и выдаёт облако точек с расстояниями. Основной источник трёхмерных данных в беспилотниках.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis, nuScenes: A multimodal dataset for autonomous driving
Частые вопросы
D4RT — это готовый продукт, который можно скачать?
Чем 4D-модель принципиально лучше обычного видеоанализа?
Нужно ли мне 4D для обычной задачи распознавания на фото?
Какое железо нужно для запуска таких моделей?
Откуда берутся 4D-данные для обучения?
Связано ли это с world models и генеративным видео?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.