Procgen и MineRL: два бенчмарка, которые ломают RL-агентов
Procgen проверяет, умеет ли агент обобщать опыт на новые уровни. MineRL — способен ли он выкопать алмаз в Minecraft за 8 миллионов шагов. Оба ответа неудобны для современных методов.

Обучение с подкреплением умеет выигрывать в Dota 2 и StarCraft, но проваливается на задачах, где среда чуть-чуть меняется от эпизода к эпизоду. Procgen Benchmark от OpenAI и соревнование MineRL на NeurIPS появились, чтобы это зафиксировать в цифрах и заставить исследователей чинить проблему, а не прятать её за миллиардами кадров тренировки.
Procgen: 16 игр, бесконечные уровни
Procgen Benchmark вышел в декабре 2019 года. Это набор из 16 аркадных сред, каждая из которых генерирует уровни процедурно: CoinRun, StarPilot, CaveFlyer, Maze, BigFish, Heist, Ninja, BossFight и другие. Агент видит картинку 64×64 и должен научиться играть так, чтобы справляться с уровнями, которых не видел в тренировке.
Главная идея — разделить train и test как в обычном машинном обучении. Классические среды вроде Atari позволяют агенту зазубрить одну и ту же последовательность действий. Procgen такой возможности не даёт: сид уровня каждый раз новый.
Агент, обученный на 500 уровнях CoinRun, показывает почти идеальный результат на них — и проваливается на новых. Разрыв между train и test и есть настоящая метрика.
Что мерят
OpenAI предложили два режима:
- Easy — 200 уровней на обучение, 25M шагов среды. Базовый режим для сравнения алгоритмов.
- Hard — 500 уровней, 200M шагов. Для тех, у кого есть вычислительный бюджет.
Метрика — нормализованный счёт: 0 у случайного агента, 1 у сильного экспертного PPO с большим бюджетом. PPO1 на Procgen Easy набирает в районе 0.5 при тестировании на новых уровнях — то есть теряет половину качества по сравнению с обучающими уровнями.
Что помогло
За несколько лет соревнований и статей сформировался короткий список приёмов, которые реально сдвигают цифры:
- аугментации кадра (random crop, cutout) — как в компьютерном зрении;
- data-regularized методы: DrAC, PLR, PPG;
- грамотный подбор уровней при тренировке — Prioritized Level Replay берёт те уровни, где агент учится быстрее всего.
MineRL: алмаз за 8 миллионов шагов
MineRL Competition стартовал на NeurIPS 2019 и проходил ежегодно. Задача ObtainDiamond звучит просто: спавн в случайном мире Minecraft, нужно добыть алмаз. По дороге агент обязан срубить дерево, сделать верстак, деревянную кирку, добыть камень, сделать каменную кирку, найти железо, выплавить его, сделать железную кирку и уже ей копать алмаз. Это цепочка примерно из десяти подзадач с редкой наградой.
Ограничения соревнования — самое интересное:
- не более 8 миллионов шагов среды на обучение;
- не более четырёх дней тренировки на одном GPU;
- обязательно использовать датасет человеческих демонстраций MineRL-v0 — около 60 миллионов кадров игры живых людей с записанными действиями.
Смысл этих рамок — заставить участников не заливать задачу вычислениями, а действительно учиться на демонстрациях и переносить навыки между подзадачами. Для сравнения: DeepMind в статьях про Atari легко расходовали сотни миллионов кадров.
Никто не выиграл честно
За первые два года ни одна команда не решила ObtainDiamond стабильно. Лучшие подходы получали алмаз в единичных процентах эпизодов. Победители обычно собирали пайплайн из имитационного обучения на демонстрациях плюс скриптованного или иерархического RL поверх — чистый end-to-end RL не сходился в отведённом бюджете.
BASALT: задачи без функции награды
В 2021 году организаторы добавили трек MineRL BASALT. Здесь задачи заданы текстом на английском: построить домик, найти водопад и красиво его сфотографировать, создать загон для животных. Функции награды нет вообще — оценивают люди-судьи по видео.
Это фактически ранний прототип задач, которые сейчас решают через RLHF2. Только не для языковых моделей, а для агентов в 3D-среде.
Чем два бенчмарка отличаются
| Параметр | Procgen | MineRL |
|---|---|---|
| Год запуска | 2019 | 2019 |
| Что проверяют | обобщение на новые уровни | sample efficiency и длинный горизонт |
| Наблюдение | RGB 64×64 | RGB 64×64 + инвентарь |
| Бюджет шагов | 25M или 200M | 8M + 60M кадров демо |
| Награда | плотная, игровая | редкая или отсутствует (BASALT) |
| Горизонт эпизода | сотни шагов | десятки тысяч шагов |
Как быстро попробовать
Procgen ставится одной командой и работает с любым RL-фреймворком:
pip install procgen
import gym
env = gym.make("procgen:procgen-coinrun-v0",
num_levels=200,
start_level=0,
distribution_mode="easy")
obs = env.reset()MineRL тяжелее: нужен Java, клиент Minecraft под капотом и терпение при первом запуске. Датасет демонстраций — десятки гигабайт. Зато среда честная: это настоящий Minecraft, а не его упрощение.
Зачем это помнить в 2024–2025
Оба бенчмарка старые по меркам области, и мода сместилась на LLM-агентов и мультимодальные модели. Но проблемы, которые они вскрыли, никуда не делись:
- агенты плохо обобщают опыт на новые визуальные условия — это видно и на современных VLA-моделях для роботов;
- длинные цепочки подзадач с редкой наградой по-прежнему требуют либо демонстраций, либо иерархии, либо и того и другого;
- оценка без явной функции награды — то, что сейчас крутится вокруг RLHF и судейских моделей, MineRL BASALT ставил ещё в 2021 году.
Если вы делаете RL-агента или обучаете политику на демонстрациях, прогнать её через Procgen и MineRL полезно хотя бы для того, чтобы увидеть, где именно ваш метод ломается. Красивые цифры на одной среде почти ничего не значат.
1 PPO — Proximal Policy Optimization, стандартный алгоритм RL от OpenAI, часто используется как базовая линия.
2 RLHF — Reinforcement Learning from Human Feedback, обучение политики по предпочтениям людей вместо явной награды.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: OpenAI: Procgen Benchmark, MineRL Competition
Частые вопросы
Можно ли решить Procgen обычным PPO?
Почему в MineRL такой странный лимит в 8 миллионов шагов?
Кто-нибудь довёл MineRL до алмаза без скриптов?
Procgen устарел или всё ещё актуален?
Чем MineRL BASALT отличается от обычного MineRL?
Стоит ли брать Procgen для дипломной работы или пет-проекта?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.