Как OpenAI Five обыграла чемпионов мира по Dota 2
В апреле 2019 года бот OpenAI Five победил команду OG — действующих чемпионов The International — со счётом 2:0. Разбираемся, что стояло за этой победой и почему она важнее шахмат и го.

13 апреля 2019 года на сцене в Сан-Франциско пятёрка нейросетей под названием OpenAI Five обыграла команду OG — победителей The International 2018, крупнейшего турнира по Dota 2 с призовым фондом свыше 25 миллионов долларов. Счёт серии best-of-three — 2:0. Это был первый случай, когда ИИ победил действующих чемпионов мира в профессиональной киберспортивной дисциплине на полноценных правилах командной игры.
Годом раньше, в августе 2018-го на The International 8, тот же проект проиграл живым командам. За восемь месяцев боты набрали столько игрового опыта, сколько человек не наберёт и за десятилетия непрерывной практики.
Почему Dota 2 сложнее шахмат и го
Победы над людьми в шахматах (Deep Blue, 1997) и го (AlphaGo, 2016) были полными играми с открытой информацией: обе стороны видят всю доску. Dota 2 устроена иначе, и именно поэтому её выбрали как испытание.
- Неполная информация. Карта частично скрыта «туманом войны» — вы не видите, что делает противник вне зоны обзора ваших героев.
- Длинный горизонт. Матч длится в среднем 45 минут. При принятии решений раз в несколько кадров это десятки тысяч ходов, где последствия раннего выбора проявляются спустя минуты.
- Огромное пространство действий. В каждый момент у героя тысячи возможных действий — перемещения, способности, предметы, комбинации.
- Командная координация. Играют пять на пять. Победа требует не индивидуального мастерства, а согласованных действий пятерых агентов без явного «капитана».
Dota 2 стала полигоном не потому, что это игра, а потому что в ней сошлись все проблемы, которые мешают ИИ работать в реальном мире: неопределённость, длинные причинно-следственные цепочки и необходимость договариваться внутри команды.
Как это было устроено
В основе OpenAI Five лежало обучение с подкреплением1 — метод, где агент учится не на размеченных примерах, а методом проб и ошибок, получая награду за приближение к цели (в данном случае — к победе). Никаких записей человеческих матчей на входе не было: боты играли сами против себя.
Масштаб вычислений
По данным OpenAI, система обучалась на игре с самой собой, проигрывая эквивалент около 180 лет игрового времени в сутки. Каждый из пяти героев управлялся отдельной копией нейросети — большой рекуррентной сети на основе LSTM. Явной коммуникации между агентами не было: координация возникала как побочный эффект общей цели и общего восприятия ситуации.
Ограничения версии
Матч против OG шёл не на полностью открытых правилах. Пул героев был ограничен, часть механик (например, некоторые типы призываемых существ и предметы вроде невидимости) отключили. Это честно оговаривалось: полноценная Dota со всеми 100+ героями оставалась за пределами возможностей системы на тот момент.
Чем игра ботов отличалась от человеческой
Комментаторы и профессиональные игроки отметили несколько чужеродных паттернов в стиле OpenAI Five.
| Аспект | Люди | OpenAI Five |
|---|---|---|
| Ранняя агрессия | Осторожная фаза линий | Постоянное давление с первых минут |
| Готовность рисковать здоровьем | Берегут запас HP | Идут в размены на грани, точно просчитывая исход |
| Реакция на потери | Эмоциональные ошибки, тильт | Мгновенный пересчёт вероятностей без «памяти» о неудаче |
| Выкуп из боя (buyback) | Экономят золото | Тратили агрессивно ради темпа |
Одна из деталей, которую подчёркивала команда: система в реальном времени оценивала свою вероятность победы. После первых удачных стычек этот показатель у ботов резко рос — и они начинали играть ещё напористее, не давая сопернику восстановиться.
Arena: люди против ботов онлайн
После шоу-матча OpenAI ненадолго открыла публичный доступ — режим OpenAI Five Arena, где любой желающий мог сыграть против ботов или вместе с ними. За несколько дней прошли тысячи матчей. Кооперативный режим показал ещё одно важное свойство: боты умели играть в паре с людьми, а не только против них — то есть подстраивались под союзников, поведение которых не контролировали.
Что это дало за пределами игры
Главный вывод проекта был не про Dota. OpenAI показала, что относительно понятные методы обучения с подкреплением масштабируются на задачи с длинным горизонтом и командной координацией, если дать им достаточно вычислений и времени на самообучение.
- Подтвердилась гипотеза, что «просто больше данных и вычислений» даёт качественный скачок, а не только количественный.
- Наработки по обучению в самостоятельной игре легли в основу дальнейших исследований OpenAI, включая проекты по робототехнике.
- Стало ясно, где предел: даже урезанная Dota потребовала колоссальных ресурсов, что подняло вопрос о доступности такого подхода для команд поменьше.
1 Обучение с подкреплением (reinforcement learning) — подход, при котором агент учится, взаимодействуя со средой: он совершает действия, получает награду или штраф и постепенно выстраивает стратегию, максимизирующую суммарную награду. В отличие от обучения с учителем, готовых «правильных ответов» ему не показывают.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: OpenAI Five defeats Dota 2 world champions (OpenAI Blog), OpenAI Five (OpenAI Blog)
Частые вопросы
С каким счётом OpenAI Five обыграла OG?
Играли ли боты на полных правилах Dota 2?
Учились ли боты на записях человеческих матчей?
Как пять ботов договаривались между собой?
Мог ли обычный игрок сыграть против OpenAI Five?
Почему Dota 2 считалась более сложной задачей, чем го?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.