OpenAI Robotics Symposium 2019: чему научила роборука Dactyl
В апреле 2019 года OpenAI собрала исследователей робототехники, чтобы обсудить, как обучать машины в симуляции и переносить навыки в реальный мир. Главным экспонатом стала рука Dactyl, собирающая кубик Рубика.

29 апреля 2019 года OpenAI провела в Сан-Франциско однодневный симпозиум по робототехнике. Формат был необычен для лаборатории: закрытые доклады, живые демонстрации, разговор между теми, кто пытается научить машины действовать в физическом мире. Поводом стала работа команды над Dactyl — антропоморфной кистью Shadow Hand, которая манипулирует объектами по политике, обученной целиком в симуляции.
Зачем понадобился симпозиум
К весне 2019 года у OpenAI накопился заметный опыт с обучением с подкреплением в физических задачах. Годом раньше та же Dactyl научилась вращать кубик с буквами и удерживать заданную ориентацию. Симпозиум стал площадкой, где авторы Dactyl обсудили с приглашёнными исследователями главную проблему области: sim-to-real transfer — перенос навыков из симулятора на железо, где трение, задержки и износ ведут себя не так, как в модели.
Среди приглашённых спикеров были Питер Аббил (UC Berkeley, Covariant), Челси Финн (Stanford), Джитендра Малик (UC Berkeley) — люди, которые формируют повестку в обучаемой робототехнике последние годы. Записи большинства докладов OpenAI позже выложила на YouTube.
Dactyl и метод рандомизации доменов
Ключевая идея, которую OpenAI отстаивала на симпозиуме, — Automatic Domain Randomization (ADR). Вместо того чтобы точно моделировать физику, симулятор специально ломают: меняют массу кубика, трение пальцев, задержки исполнителей, освещение и текстуры. Политика, выжившая в тысячах вариантов мира, оказывается устойчивой и в реальном.
Если модель работает в миллионе разных симуляций, реальный мир для неё — просто ещё одна симуляция.
Обучение шло на кластере с сотнями GPU и десятками тысяч CPU-ядер. По оценкам самой OpenAI, на политику Rubik's Cube ушло порядка 13 тысяч лет опыта в симуляции — это стало одним из самых обсуждаемых чисел симпозиума.
Что показывали на демо
- Вращение кубика Рубика одной кистью — с решением, которое считал классический алгоритм Kociemba.
- Устойчивость к помехам: экспериментаторы надевали на пальцы резинки, связывали два пальца, тыкали в кубик карандашом — рука адаптировалась.
- Провалы: кубик регулярно падал, полное решение из случайного состояния получалось примерно в 20% попыток для 15 поворотов и около 60% для лёгких сборок.
Спор с классической школой
Симпозиум обнажил разлом внутри сообщества. Одни считают, что обучение с подкреплением в симуляции — универсальный путь к общей робототехнике. Другие настаивают на модульных системах: планировщик, контроллер, восприятие — каждое со своей математикой и гарантиями.
| Подход | Данные | Гибкость | Гарантии |
|---|---|---|---|
| End-to-end RL + sim2real (OpenAI) | Миллиарды шагов в симуляции | Высокая: одна политика на класс задач | Слабые, нужны эмпирические тесты |
| Имитационное обучение (Stanford, Berkeley) | Демонстрации человека | Средняя, зависит от покрытия | Ограниченные |
| Классическое планирование + MPC | Модели и калибровка | Низкая, задача под задачу | Формальные, при верной модели |
Аргумент критиков RL прост: 13 тысяч симулированных лет ради одного кубика — цена, которую индустрия не готова платить за каждую новую задачу. Ответ OpenAI: политика, обученная под кубик, показала перенос на другие объекты без переобучения — а значит, инвестиция окупается на классе задач, а не на одной.
Инженерная сторона
Часть докладов была посвящена не алгоритмам, а инфраструктуре. Симуляция велась в MuJoCo и собственном форке Rapid, обучение — на PPO*. Отдельный доклад разбирал, как синхронизировать тысячи воркеров и не терять эпизоды при рестартах.
# Упрощённый цикл ADR из презентации
for step in range(N):
params = adr.sample() # случайные параметры мира
env = make_env(params)
trajectory = rollout(policy, env)
policy = ppo_update(policy, trajectory)
if success_rate(policy, params) > threshold:
adr.expand(params) # расширяем диапазон рандомизации
* PPO, Proximal Policy Optimization — алгоритм обучения с подкреплением, предложенный OpenAI в 2017 году; стал стандартом для непрерывных задач управления.
Что осталось после симпозиума
Прямых продуктов из Dactyl не выросло: в 2021 году OpenAI закрыла робототехническое направление, посчитав, что данные из реального мира собирать медленнее, чем прогрессирует языковое направление. Но идеи симпозиума пережили саму команду.
- Automatic Domain Randomization используется в стартапах вроде Covariant и в академических работах по манипуляции.
- Связка «симуляция + масштаб + PPO» стала базовой для промышленных задач сборки и упаковки.
- Идея измерять устойчивость политик стресс-тестами (резинки, толчки) прижилась как стандарт демонстраций.
Симпозиум 2019 года — редкий случай, когда лаборатория собрала оппонентов и показала свой метод в работе, не пряча провальные попытки. Через полгода вышла статья Solving Rubik's Cube with a Robot Hand, где часть тезисов симпозиума получила формальное подтверждение.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Solving Rubik's Cube with a Robot Hand — OpenAI, Learning Dexterous In-Hand Manipulation — OpenAI
Частые вопросы
Где посмотреть записи докладов?
Действительно ли Dactyl собирала кубик Рубика полностью сама?
Почему OpenAI закрыла робототехническое направление?
Что такое sim-to-real transfer простыми словами?
Можно ли повторить эксперимент вне OpenAI?
Как ADR отличается от обычной рандомизации доменов?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.