Retro Contest: как учат ИИ проходить незнакомые уровни
Соревнование OpenAI Retro Contest проверяло не то, кто пройдёт Sonic the Hedgehog, а кто пройдёт уровни, которых агент в глаза не видел. Именно на этом обычно и ломается обучение с подкреплением.

В 2018 году OpenAI провела конкурс Retro Contest, в котором участники обучали ИИ-агентов играть в Sonic the Hedgehog для Sega Genesis. Ключевой момент: тренировали агентов на одном наборе уровней, а оценивали на другом — на уровнях, специально сделанных так, чтобы участники их не видели. Это разворот привычной постановки задачи. Большинство громких результатов в обучении с подкреплением к тому моменту показывали, как агент выжимает максимум из тех же условий, в которых учился. Retro Contest спрашивал другое: перенесёт ли агент навык на новую обстановку.
Зачем понадобился ещё один игровой бенчмарк
К 2018 году агенты уже уверенно обыгрывали людей в Atari, Go и десятках других игр. Но за этими цифрами скрывалась неудобная деталь: агент, натренированный на конкретном уровне, часто оказывался беспомощен на слегка изменённом. Он не столько учился играть, сколько заучивал последовательность действий под конкретную обстановку. Это переобучение — только не на статичном датасете, а на среде.
OpenAI хотела измерить обобщение1 — способность переносить выученное поведение на новые, но родственные задачи. Sonic подходил хорошо: сотни рукотворных уровней с общей механикой (бег, прыжки, инерция, петли), но с разной геометрией. Можно разбить их на обучающую и тестовую выборки так, как это делают с обычными данными в машинном обучении, и честно проверить перенос.
Как была устроена оценка
Участникам давали доступ к обучающим уровням из трёх игр серии Sonic. Финальная оценка шла на закрытом наборе уровней, которых в открытом доступе не было — их создали специально для конкурса. Важное условие: агенту разрешалось дообучаться прямо на тестовом уровне ограниченное время (порядка миллиона шагов игры на уровень), но не заранее. То есть проверялось не «сколько агент помнит», а «как быстро он приспосабливается к незнакомому».
Заучить прохождение уровня и научиться играть в игру — это две разные задачи. Retro Contest ставил вторую и отказывался засчитывать первую.
Инструментарий: Gym Retro
Под конкурс OpenAI выпустила Gym Retro — обёртку, которая подключала эмуляторы классических консолей к привычному интерфейсу Gym. Это дало исследователям единый способ запускать сотни ретро-игр как среды для обучения с подкреплением, а не только полтора десятка Atari-тайтлов из старого набора. Sega Genesis была лишь одной из поддерживаемых платформ.
Практический смысл прост: чем больше разнообразных сред с общей структурой, тем честнее можно измерять обобщение. Одна игра — это одна выборка. Библиотека игр — это уже полигон.
Что показали результаты
OpenAI заранее прогнала на задаче несколько базовых подходов, чтобы участникам было с чем себя сравнивать. Общая картина по итогам конкурса оказалась отрезвляющей: сильные на тот момент алгоритмы, взятые «из коробки», переносили навык на новые уровни заметно хуже, чем хотелось бы. Разрыв между результатом на знакомых и незнакомых уровнях был велик.
Победившие решения не изобретали принципиально новую математику. Они брали проверенные алгоритмы и аккуратно настраивали дообучение под новый уровень — то есть выигрывал тот, кто лучше решал именно задачу быстрой адаптации, а не тот, у кого мощнее базовая модель.
Типичные подходы участников
- Дообучение поверх предобученной политики. Агент приходит на новый уровень не с нуля, а с весами, натренированными на обучающем наборе, и дошлифовывает их за отведённые шаги.
- Алгоритмы семейства policy gradient вроде PPO как рабочая лошадка — за предсказуемость и устойчивость к настройкам.
- Аккуратная работа с наградой и исследованием, чтобы агент не застревал в локальных ловушках уровня, которых не было в обучении.
Сравнение постановок задачи
| Параметр | Классический RL-бенчмарк | Retro Contest |
|---|---|---|
| Где учится агент | На целевой среде | На обучающем наборе уровней |
| Где оценивается | На той же среде | На закрытых незнакомых уровнях |
| Что измеряется | Итоговое качество игры | Скорость и качество адаптации к новому |
| Главный риск | Переобучение под среду | Провал переноса навыка |
Почему это до сих пор актуально
Проблема, которую подсветил Retro Contest, никуда не делась. Агент, отлично работающий в лаборатории, легко ломается при малейшем сдвиге условий — будь то другой уровень игры, изменившийся интерфейс сайта или новая раскладка склада для робота. Способность обобщать, а не заучивать, остаётся одним из узких мест прикладного RL.
Идея разделять обучающие и тестовые среды, а не только данные, стала после этого гораздо привычнее. Если вы оцениваете обучающегося агента на тех же условиях, в которых он тренировался, вы измеряете память, а не интеллект — и Retro Contest сделал этот тезис наглядным на понятном всем примере: синий ёж, незнакомый уровень, часы на дообучение.
1 Обобщение (generalization) — способность модели или агента показывать хороший результат на данных или задачах, которые не встречались во время обучения. Противоположность — переобучение, когда система хорошо работает только на знакомом.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: OpenAI — Retro Contest, OpenAI — Gym Retro
Частые вопросы
Что именно нужно было делать участникам Retro Contest?
Чем это отличается от обычных игровых бенчмарков вроде Atari?
Что такое Gym Retro?
Какие алгоритмы работали лучше всего?
Можно ли повторить эксперимент сегодня?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.