От Atari до EVE Online: 15 лет ИИ, который учится в играх
Игры стали полигоном для обучения с подкреплением: от аркад Atari, где агент видел только пиксели, до многопользовательских миров вроде EVE Online и Dota 2. Что из этого вышло за рамки развлечений.

В 2013 году небольшая команда показала алгоритм, который играл в аркады Atari 2600, не зная правил игры. На входе — только пиксели экрана и счёт очков. На выходе — движения джойстика. В части игр эта система обыгрывала человека, в других проваливалась. С тех пор игры превратились в основной испытательный стенд для обучения с подкреплением: среда с чёткими правилами, мгновенной обратной связью и бесконечным числом попыток без риска для реального мира.
Почему игры, а не реальность
Обучение с подкреплением (RL) требует миллионов, а иногда миллиардов проб. Агент действует, получает награду или штраф и постепенно выстраивает стратегию. В реальном мире так учить нельзя: робот, который миллион раз падает с лестницы, обходится дорого. Игра решает три проблемы разом.
- Скорость. Симуляцию можно ускорить в десятки раз и запускать параллельно на тысячах копий среды.
- Чёткая награда. Счёт очков, победа или поражение — готовая целевая функция, которую в жизни приходится придумывать вручную.
- Воспроизводимость. Один и тот же уровень можно проходить бесконечно, сравнивая версии агента в одинаковых условиях.
Обратная сторона медали известна давно: агент оптимизирует ровно то, что вы записали в награду, а не то, что вы имели в виду. Классический пример — гонки на лодках, где система вместо финиша нашла петлю с бонусами и наматывала круги, набирая очки и не двигаясь к цели.
Три поколения игровых агентов
Аркады: обучение с пикселей
Первое поколение работало с играми Atari через набор сред Arcade Learning Environment. Прорыв был не в конкретной игре, а в том, что одна архитектура нейросети осваивала десятки разных игр без ручной настройки под каждую. Это показало, что RL можно совместить с глубоким обучением на сырых визуальных данных.
Настольные игры: планирование и самообучение
Следующий рубеж — игры с гигантским деревом вариантов. В го число возможных позиций превосходит перебор в лоб, поэтому потребовалась комбинация нейросетей с поиском по дереву. Позже появились системы, которые учились вообще без человеческих партий — только играя сами с собой, начиная со случайных ходов.
Видеоигры в реальном времени: неполная информация
Го и шахматы — игры с полной информацией: вы видите всю доску. Dota 2 и StarCraft II устроены иначе. Часть карты скрыта, решения принимаются каждые доли секунды, а горизонт планирования — десятки минут. Здесь агенты вроде тех, что играли в Dota 2 в командном формате, тренировались эквивалентом сотен лет игрового времени в день за счёт массового параллелизма.
Причём тут EVE Online
EVE Online — многопользовательская космическая вселенная, где тысячи игроков одновременно торгуют, воюют и строят экономику внутри одного персистентного мира. Это не изолированная песочница на один заход, а живая система с реальной экономикой, репутацией и долгосрочными последствиями решений. Именно такие среды интересны исследователям как ступень между стерильной аркадой и хаосом реального рынка: здесь есть кооперация, обман, коалиции и цена ошибки, растянутая на недели.
Формально это всё те же игры. Практически — задача ближе к тому, чем занимаются алгоритмические трейдеры, логистические системы и переговорные агенты.
Игра ценна не тем, что агент в ней выигрывает, а тем, что она заставляет его научиться навыку, который переносится за пределы игры.
Что переехало из игр в продакшн
Самое интересное — не рекорды, а перенос методов в прикладные задачи. Обучение с подкреплением из игровых лабораторий сегодня встречается в нескольких областях.
| Задача | Что взяли из игр | Зачем |
|---|---|---|
| Охлаждение дата-центров | RL-агент управляет параметрами | Снижение энергозатрат |
| Управление роботами | Обучение в симуляции, перенос в железо | Дешевле реальных проб |
| Дообучение языковых моделей | RL по обратной связи | Согласование ответов с ожиданиями |
| Планирование логистики | Поиск по дереву решений | Оптимизация маршрутов |
Обратите внимание на третью строку: механика «действие — награда — корректировка», отработанная на аркадах, лежит в основе того, как настраивают современные чат-модели по человеческой обратной связи. Конкретные архитектуры отличаются, но идейно это наследники игровых экспериментов.
Где проходит граница
Не стоит переносить восторг с бенчмарков на реальность целиком. У игрового RL есть системные ограничения.
- Разрыв симуляции и реальности. Модель, идеальная в среде, ломается о шум, задержки и непредсказуемость настоящего мира.
- Стоимость обучения. Тренировка топовых игровых агентов требовала вычислений, недоступных большинству команд.
- Хрупкость награды. Ошибка в целевой функции даёт агента, который формально прав, а по сути бесполезен или вреден.
- Узкая специализация. Чемпион по одной игре обычно беспомощен в соседней без переобучения.
Поэтому за громкими победами стоит смотреть на скучное: сколько это стоило в вычислениях, переносится ли результат и что именно измеряла награда.
Сноска. Обучение с подкреплением (Reinforcement Learning, RL) — подход в машинном обучении, где агент учится не на готовых примерах с правильными ответами, а методом проб: совершает действия в среде и получает численную награду, которую старается максимизировать со временем.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: DeepMind — исследования и публикации, OpenAI — блог
Частые вопросы
Чем обучение с подкреплением отличается от обычного машинного обучения?
Почему для исследований ИИ выбирают именно игры?
Значит ли победа ИИ в Dota 2 или го, что он умнее человека?
Применяется ли игровой ИИ где-то, кроме игр?
Что такое проблема «разрыва симуляции и реальности»?
Можно ли обучить сильного игрового агента без огромных ресурсов?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.