Sonic-бенчмарк: как проверяют обобщение в обучении с подкреплением
Агент, который прошёл 100 уровней Sonic, обычно проваливает 101-й. Бенчмарк Gotta Learn Fast разделил уровни на обучающие и тестовые, чтобы измерить не заучивание, а перенос навыка на новое.

Классическая история обучения с подкреплением: агент обыгрывает человека в конкретной игре Atari, но стоит поменять расположение платформ — и он беспомощен. Он не научился играть, он заучил один уровень. Бенчмарк Gotta Learn Fast, представленный OpenAI, бьёт именно по этой болевой точке: он проверяет, умеет ли агент быстро осваиваться на уровнях, которых не видел при обучении, а не пересчитывать по памяти заученную траекторию.
В основе — игры серии Sonic the Hedgehog на Sega Genesis, запущенные через среду Gym Retro. Уровни жёстко поделены: одна часть отдана на обучение, другая закрыта до момента оценки. Метрика измеряет не то, как высоко агент прыгнет на знакомой карте, а сколько очков он наберёт за ограниченное число шагов на новой.
Почему обобщение — отдельная задача
Большинство громких результатов в RL получены в режиме, где обучение и тест идут на одной и той же среде. Агент миллионы раз проходит уровень и в итоге запоминает оптимальную последовательность действий. Это впечатляет на демонстрации, но мало говорит о том, научилась ли модель чему-то переносимому.
Обобщение (generalization) в RL — способность применять выученное поведение к ситуациям, отсутствовавшим в обучающей выборке. В обучении с учителем для этого давно есть стандарт: обучающая и тестовая выборки не пересекаются. В RL такой гигиены долго не хватало, потому что среды дорого разнообразить.
Агент, который набирает максимум очков на уровне, виденном миллион раз, и агент, который быстро разбирается в новом уровне, — это два разных умения. Бенчмарк создан, чтобы их не путать.
Sonic для этого удобен: десятки уровней с общими механиками (кольца, пружины, петли, враги), но разной геометрией. Механика переносима, конкретная карта — нет. Ровно то разделение, которое нужно для честной проверки.
Как устроена оценка
Схема бенчмарка сводится к нескольким принципам:
- Разделение уровней. Тестовые уровни закрыты во время обучения — агент видит их впервые на оценке.
- Ограниченный бюджет. На каждом тестовом уровне агенту даётся фиксированное число шагов взаимодействия, чтобы адаптироваться. Заучить с нуля за это время нельзя.
- Разрешённая дообучаемость. На тесте агенту можно продолжать учиться на новом уровне — но именно скорость адаптации, а не финальное заучивание, попадает в метрику.
- Единая метрика очков. Результат нормируется так, чтобы уровни разной сложности можно было сравнивать.
Ключевой акцент — на слове fast из названия. Ценится не то, что агент в принципе способен пройти уровень при бесконечном тренинге, а то, как быстро он выходит на приличный результат на незнакомой карте.
Что показали базовые подходы
OpenAI прогнали через бенчмарк несколько семейств методов и сравнили их с человеком. Общая картина оказалась отрезвляющей: методы, отлично работающие в режиме «обучение равно тест», заметно проседают, когда уровень новый.
| Подход | Идея | Поведение на новых уровнях |
|---|---|---|
| Обучение с нуля на тестовом уровне | Агент учится прямо на незнакомой карте в рамках бюджета шагов | Медленный старт, за ограниченное время далеко не уходит |
| Совместное обучение (joint training) | Модель учится сразу на всех тренировочных уровнях, затем адаптируется к тесту | Стартует лучше за счёт переносимых навыков, но до человека не дотягивает |
| Человек | Игрок с ограниченным временем на незнакомом уровне | Ориентир сверху: адаптируется заметно эффективнее алгоритмов |
Разрыв между агентами и человеком на новых уровнях — главный результат бенчмарка. Он показывает, что задача обобщения в RL далеко не решена, а прежние успехи во многом объяснялись совпадением обучающей и тестовой среды.
Meta-learning как ожидаемое направление
Логичный кандидат на закрытие разрыва — мета-обучение1: не просто выучить политику для конкретных уровней, а научиться быстро учиться на новых. В теории именно такой агент должен на незнакомой карте за считанные попытки понять, что кольца полезны, а шипы смертельны, и перенести это знание. На практике готового решения, стабильно обгоняющего человека на этом бенчмарке, из коробки не оказалось — что и делает задачу интересной.
Почему это важно за пределами Sonic
Sonic здесь — не самоцель, а удобный полигон. Проблема одинакова для роботов, торговых агентов и рекомендательных систем: среда в реальности почти никогда не совпадает с той, на которой обучались. Робот, отлаженный в одном цеху, попадает в другой; агент, обученный на исторических данных, встречает новый режим рынка.
Бенчмарк даёт этому измеримую форму. Если метод хорош, он должен показывать не только высокий потолок на знакомых уровнях, но и быструю адаптацию на закрытых. Это меняет то, как читать таблицы результатов в RL-статьях: цифра без указания, совпадали ли обучение и тест, теперь выглядит подозрительно.
1 Мета-обучение (meta-learning, «обучение учиться») — подход, при котором модель тренируют не решать одну задачу, а быстро осваивать новые задачи из общего распределения за небольшое число примеров или шагов.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: OpenAI — Gotta Learn Fast: A New Benchmark for Generalization in RL
Частые вопросы
Чем Gotta Learn Fast отличается от обычных RL-бенчмарков вроде Atari?
На какой игре построен бенчмарк?
Можно ли агенту дообучаться на тестовых уровнях?
Кто выигрывал — человек или алгоритмы?
Зачем это нужно, если речь о видеоигре?
Какой метод считается перспективным для обобщения в RL?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.