Робот OpenAI собрал кубик Рубика одной рукой — но это не про кубик
В 2019 году OpenAI показала, как роборука Shadow Dactyl решает кубик Рубика. Проект закрыли через два года, но именно он задал спор о том, где предел обучения роботов в симуляции.

15 октября 2019 года OpenAI опубликовала видео: пятипалая роборука Shadow Dactyl держит кубик Рубика и медленно, с паузами, собирает его за несколько минут. Кубик она хватала одной рукой, вторая рука в эксперименте не участвовала — только пальцы, ладонь и алгоритм. Через два года лабораторию робототехники в OpenAI распустили, а исследователи ушли в стартапы. История короткая, но именно вокруг неё до сих пор спорят: это был прорыв в обучении роботов или дорогая демонстрация с двойным дном.
Что именно сделали
Само решение кубика — задача давно решённая. Алгоритм Коцембы находит сборку за 20 ходов и меньше, его крутят на школьных Arduino-проектах. Сложность была в другом: научить руку из 24 степеней свободы физически вращать грани, не роняя кубик, не заклинивая пальцы и справляясь с помехами, которых во время обучения она никогда не видела.
Внутри кубика был датчик Bluetooth от Giiker — он сообщал текущее состояние граней. Положение самого кубика в руке отслеживали три RGB-камеры. Дальше в дело вступала нейросеть-контроллер, обученная целиком в симуляции.
Automatic Domain Randomization
Главная идея работы называлась ADR — автоматическая рандомизация домена. В симуляции меняли всё, что можно поменять: массу кубика, трение пальцев, задержки моторов, освещение, углы камер, шум сенсоров. Причём меняли не вручную, а автоматически: как только сеть начинала уверенно справляться, диапазон параметров расширяли.
Смысл простой. Если модель научилась работать в тысяче разных «вселенных», реальный мир для неё — просто ещё одна вселенная из этого набора. Никакого дообучения на настоящей руке не требовалось.
Мы не учим робота собирать кубик. Мы учим его справляться с миром, который постоянно меняется под ним. Кубик — просто повод.
Сколько это стоило
OpenAI официально не раскрывала бюджет проекта, но по косвенным данным порядок величин известен.
| Ресурс | Оценка |
|---|---|
| Обучение одной политики | ~13 тыс. лет симулированного опыта |
| Вычисления | сотни GPU параллельно, недели работы |
| Роборука Shadow Dexterous Hand | от 100 тыс. долларов за экземпляр |
| Успешность полной сборки | 60% для лёгких скрамблов, 20% для сложных |
В пересчёте на облачные ставки 2019 года обучение одной итерации политики стоило по разным оценкам от сотен тысяч до нескольких миллионов долларов. Ради задачи, которую механический кубособиратель за 200 долларов решает за 0,38 секунды.
Почему это всё-таки важно
Критики сразу заметили: кубик решает классический алгоритм, а не нейросеть. Роль ИИ — только манипуляция. И это правда. Но именно манипуляция мелкими объектами пальцами оставалась (и остаётся) одной из самых трудных задач робототехники.
- Захват и удержание объекта неправильной формы одной рукой без соскальзывания.
- Повороты граней, требующие временного «отпускания» части кубика.
- Восстановление после помех — исследователи тыкали руку жирафом из плюша, надевали на неё резиновую перчатку, привязывали пальцы. Она продолжала работу.
Ни один из этих сценариев в обучении не встречался. Это и есть аргумент в пользу ADR: обобщение на реальный мир получилось за счёт разнообразия симуляции, а не за счёт данных с настоящего железа.
Подводные камни, о которых говорили реже
Во-первых, 60% успеха для 15-ходовой сборки — это на самом деле немного. Для 26-ходовой (максимальная сложность) — уже 20%. То есть в четырёх случаях из пяти сложная сборка проваливалась.
Во-вторых, «одной рукой» — с оговорками. Кубик со встроенным Bluetooth-датчиком тяжелее обычного и имеет специфическое распределение массы. Обычный спидкубический кубик рука не собирала.
В-третьих, время. Средняя сборка занимала около четырёх минут — на порядки медленнее человека-любителя.
Что случилось с проектом
В июле 2021 года глава робототехнического направления OpenAI Войцех Заремба подтвердил, что команда распущена. Официальная причина — нехватка данных для обучения общих роботов и решение сфокусироваться на языковых моделях. Через год после этого вышла GPT-3.5, а ещё через несколько месяцев — ChatGPT. Задним числом решение выглядит логичным.
Но идеи ADR никуда не делись. Их подхватили в стартапах: Physical Intelligence, Covariant, 1X, Figure. Sim-to-real перенос с массивной рандомизацией стал стандартом в обучении манипуляторов.
Что осталось в сухом остатке
- Обучение роботов целиком в симуляции работает, если симуляция достаточно разнообразна.
- Обобщение к незнакомым помехам возможно без единого примера этих помех в обучающей выборке.
- Экономически такой подход в 2019 году не окупался ни для одной прикладной задачи. Сейчас — вопрос открытый.
- Демонстрация с кубиком была не про кубик и не про робота. Она была про метод. И метод пережил проект.
Через шесть лет после того видео крупные лаборатории снова тратят миллионы GPU-часов на обучение роботов — только теперь под задачи вроде складывания белья и разгрузки посудомойки. Кубик Рубика в этом смысле оказался тестом, на котором проверили инструмент, прежде чем взять его в настоящую работу.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Solving Rubik's Cube with a Robot Hand — OpenAI, Solving Rubik's Cube with a Robot Hand (arXiv:1910.07113)
Частые вопросы
Робот сам решал, как собирать кубик?
Почему нельзя было обучать сразу на настоящей руке?
Что такое ADR простыми словами?
Почему OpenAI закрыла направление робототехники?
Есть ли сейчас роботы, которые собирают кубик быстрее человека?
Использует ли кто-то подход OpenAI сегодня?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.