Ловкость роборук: почему манипуляция даётся ИИ тяжелее ходьбы
Роботы научились бегать и делать сальто, но до сих пор роняют кубик и не могут завязать шнурки. Разбираем, почему ловкость кисти — нерешённая задача и что меняют обучение с подкреплением и симуляции.

Робот Boston Dynamics делает сальто назад, четвероногий Spot карабкается по щебню, а гуманоид Figure раскладывает посуду в демо-роликах. При этом взять со стола связку ключей, повернуть их в пальцах и вставить в замок — задача, на которой спотыкаются лучшие лаборатории мира. Ходьба и бег оказались проще, чем то, что человеческий ребёнок осваивает к трём годам: манипуляция предметами кистью руки.
Разрыв объясняется не мощностью моторов, а числом степеней свободы и характером контакта. Ходьба — это ритмичный, во многом периодический процесс с небольшим числом точек опоры. Захват и вращение предмета в ладони — это десятки контактов, которые появляются и исчезают за миллисекунды, с трением, проскальзыванием и деформацией. Именно этим — dexterous manipulation, ловкой манипуляцией — последние годы плотно занимаются в OpenAI, DeepMind, NVIDIA и университетских лабораториях.
Что такое ловкость в терминах робототехники
Под ловкостью понимают способность манипулятора менять положение и ориентацию предмета в руке без опоры на внешние поверхности — так называемая in-hand manipulation. Классический бенчмарк — повернуть кубик или сложную фигуру нужной гранью вверх, перебирая пальцами.
Сложность здесь в трёх вещах сразу:
- Много степеней свободы. Человеческая кисть имеет около 27 степеней свободы. Роборуки вроде Shadow Hand приближаются к этому числу, и каждым сочленением надо управлять согласованно.
- Контактная динамика. Сила, с которой палец давит на предмет, определяет, удержится он или выскользнет. Модели трения плохо предсказуемы, а физические симуляторы считают контакт приближённо.
- Неполная информация. Пальцы закрывают предмет от камеры. Робот часто не видит того, что держит, и вынужден полагаться на тактильные датчики, которых у большинства манипуляторов до сих пор нет.
Почему классические алгоритмы буксуют
Традиционный подход — аналитически описать динамику и просчитать траекторию каждого пальца — работает для жёстких предсказуемых сцен: заводская сборка, где деталь всегда в одном положении. Как только предмет незнакомый или мягкий, а контакт непредсказуем, точная модель либо недостижима, либо считается слишком долго для реального времени.
Робот, который уверенно собирает один и тот же узел на конвейере миллион раз, беспомощен перед незнакомой кружкой. Обобщение — а не точность на одной задаче — вот настоящий барьер ловкости.
Ставка на обучение с подкреплением и симуляцию
Прорыв последних лет связан с обучением с подкреплением * в симуляции. Вместо того чтобы программировать движения вручную, агенту дают награду за успех — например, за то, что кубик повёрнут нужной гранью, — и он методом проб и ошибок находит стратегию сам.
Ключевая идея — domain randomization: в симуляторе случайно меняют массу предмета, трение, задержки моторов, шум датчиков. Политика, обученная выживать в тысячах вариантов виртуального мира, легче переносится на реальную руку, где параметры заранее неизвестны. Именно так команда OpenAI ещё в проекте с манипуляцией кубиком на Shadow Hand добилась переноса из симуляции в железо без дообучения на реальных данных.
Симуляция даёт главное преимущество — масштаб. Физический движок NVIDIA Isaac Gym способен прогонять тысячи параллельных копий сцены на одном GPU, собирая годы виртуального опыта за часы. Реальная рука столько повторений не выдержала бы физически.
Тактильные данные меняют картину
Отдельное направление — тактильные сенсоры. Датчики вроде GelSight снимают деформацию мягкой поверхности пальца камерой изнутри и дают изображение точки контакта с высоким разрешением. Это возвращает роботу то, чего лишает зрение при захвате: понимание, где именно и с какой силой предмет касается пальца, и начал ли он проскальзывать.
Симуляция против реального мира
| Критерий | Обучение в симуляции | Обучение на реальном роботе |
|---|---|---|
| Скорость сбора опыта | Тысячи параллельных сред, годы опыта за часы | Реальное время, износ железа |
| Стоимость ошибки | Нулевая, предмет не ломается | Поломка захвата, порча предмета |
| Точность физики | Приближённая, особенно контакт и трение | Настоящая, без упрощений |
| Главный риск | Разрыв sim-to-real: модель не переносится | Мало данных, медленно, дорого |
На практике лаборатории комбинируют оба пути: основную политику учат в симуляции, затем дообучают на небольшом объёме реальных данных, чтобы закрыть разрыв.
Куда это ведёт на рынке
Ловкость — узкое место для гуманоидных роботов, в которые вкладываются Figure, Tesla с проектом Optimus, Agility Robotics и другие. Робот, который умеет ходить по складу, но не способен аккуратно взять и переложить произвольную коробку, коммерчески бесполезен на большинстве операций. Именно манипуляция, а не локомоция, определяет, попадут ли гуманоиды дальше эффектных демо.
Что стоит держать в голове, читая новости об очередном роботе:
- Демо на одном предмете в контролируемой сцене — не то же самое, что работа с произвольными объектами. Спрашивайте, тестировали ли на незнакомых предметах.
- Скорость и надёжность важнее одиночного успеха. Схватить кружку один раз из десяти для склада бесполезно.
- Наличие тактильных датчиков — сигнал, что команда всерьёз работает над контактом, а не только над зрением.
Ловкость останется тем рубежом, по которому честно измеряется прогресс в робототехнике. Пока робот не может уверенно повторить то, что делают ваши пальцы, застёгивая пуговицу, разговоры о замене человека физическим ИИ стоит воспринимать с поправкой на маркетинг.
* Обучение с подкреплением (reinforcement learning) — метод машинного обучения, где агент учится действиям через вознаграждение за нужный результат, а не на размеченных примерах.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: OpenAI — Solving Rubik's Cube with a robot hand, NVIDIA Isaac Gym documentation
Частые вопросы
Почему роботу проще ходить, чем брать предметы рукой?
Что такое sim-to-real и почему это проблема?
Зачем роботам тактильные датчики, если есть камеры?
Умеют ли современные роботы работать с любыми предметами?
Почему ловкость важна для гуманоидных роботов?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.