Любопытство вместо наград: чему учит агентов внутренняя мотивация
Исследователи OpenAI запустили пятьдесят четыре агента в играх без единой внешней награды — они учились, гоняясь только за новизной. В Super Mario Bros это провело агента через 11 уровней. Разбираем, как работает curiosity-driven learning и где он ломается.

В 2018 году команда OpenAI и Калифорнийского университета в Беркли (Юрий Бурда, Харри Эдвардс, Дипак Патхак и коллеги) опубликовала работу Large-Scale Study of Curiosity-Driven Learning. Они запустили обучение с подкреплением на 54 средах — от 48 игр Atari до Super Mario Bros и симулятора физики Roboschool — и убрали из них главное, ради чего обычно учат агентов: внешнюю награду. Ни очков, ни флажков, ни сигнала «ты выиграл». Единственным двигателем осталось любопытство — стремление модели попадать в состояния, которые она плохо умеет предсказывать. В Mario такой агент без единого очка прошёл больше 11 уровней.
Что такое curiosity-driven learning
Обычный агент обучения с подкреплением получает награду от среды: съел точку в Pac-Man — плюс балл, врезался — минус жизнь. Проблема в том, что во многих реальных и игровых задачах награда редкая или её вовсе нет. Агент может бродить часами, ни разу не наткнувшись на положительный сигнал, и не понять, что делать.
Curiosity-driven подход заменяет внешнюю награду на внутреннюю. Агент строит модель, предсказывающую следующее состояние среды по текущему состоянию и действию. Там, где предсказание ошибается сильнее всего, генерируется внутренняя награда — сигнал «здесь интересно, я этого не ожидал». Агент начинает целенаправленно искать новизну: незнакомые экраны, новые механики, неизведанные комнаты.
Почему нельзя просто награждать за ошибку предсказания
Наивная версия ломается о так называемую проблему шумного телевизора. Если в среде есть источник чистой случайности — например, экран со статическим шумом, — предсказать его следующий кадр невозможно в принципе. Ошибка предсказания там всегда максимальна, и любопытный агент застревает перед этим экраном навсегда, как человек, залипший на помехи.
Любопытство, построенное на ошибке предсказания в пикселях, притягивается не к новому, а к непредсказуемому. А это не одно и то же: подброшенная монета непредсказуема, но ничему не учит.
Ключевой приём: предсказывать признаки, а не пиксели
Главный технический вопрос работы — в каком пространстве измерять новизну. Авторы сравнили несколько способов кодирования наблюдений перед тем, как строить предсказание:
| Пространство признаков | Как устроено | Итог по исследованию |
|---|---|---|
| Сырые пиксели | Предсказание следующего кадра напрямую | Плохо переносит шум и лишние детали |
| Случайные признаки (RF) | Фиксированная случайная нейросеть-кодировщик | Неожиданно сильный и стабильный базовый вариант |
| VAE | Вариационный автокодировщик | Работает, но менее стабильно |
| Inverse Dynamics Features (IDF) | Признаки, обученные предсказывать действие по паре состояний | Лучшая обобщаемость на новые уровни |
Идея IDF в том, чтобы кодировщик обращал внимание только на то, на что агент реально влияет своими действиями. Мерцающий фон, случайные частицы, шум — всё, что не зависит от действий агента, отфильтровывается. Именно IDF показали лучший перенос знаний: агент, натренированный любопытством на одних уровнях Mario, увереннее вёл себя на новых.
Что получилось в цифрах
Результаты, ради которых работу и запомнили:
- В большинстве из 48 игр Atari чисто внутренняя награда коррелировала с ростом игрового счёта — то есть агент, гоняясь за новизной, попутно учился играть хорошо, хотя очки ему никто не показывал.
- В Super Mario Bros любопытствующий агент прошёл более 11 уровней без внешней награды: продвижение вперёд открывает новые экраны, а новые экраны — это новизна, за которой агент и охотится.
- В Pong два таких агента вместо того, чтобы выигрывать, научились как можно дольше держать мяч в игре — долгий розыгрыш даёт больше разнообразных состояний, чем быстрая победа.
- Масштаб пакетов обучения (batch) имел значение: большее число параллельных сред делало сигнал любопытства устойчивее.
Последний пункт про Pong важен как предупреждение. Внутренняя мотивация не эквивалентна цели разработчика. Агент оптимизирует новизну, а не победу, и его поведение может расходиться с тем, что вы от него ждали.
Где это ломается
Авторы честно показали границы подхода. В игре Unity, где по нажатию кнопки на экране включался телевизор со случайным контентом, любопытный агент действительно застревал у этого телевизора — та самая проблема шума в чистом виде. IDF смягчают её, но не устраняют полностью: если случайность влияет на состояние, отфильтровать её сложнее.
Второе ограничение — расхождение целей. Чистое любопытство хорошо там, где движение к новизне совпадает с прогрессом по задаче (как в Mario). Там, где не совпадает, одной внутренней награды мало, и её приходится комбинировать с внешней.
Почему это до сих пор обсуждают
Работа стала одной из опорных для целого направления intrinsic motivation в обучении с подкреплением. Она показала на большой выборке сред, а не на одной-двух демонстрациях, что агент может обучаться осмысленному поведению вообще без разметки награды — самого дорогого и хрупкого элемента RL-задач. Это перекликается с современными агентами, которые исследуют среды и интерфейсы без пошаговых инструкций.
Что забрать с собой
- Внутренняя награда за новизну способна заменить внешнюю в средах, где прогресс и новизна идут рука об руку.
- Измерять новизну лучше в пространстве обученных признаков (IDF), а не в сырых пикселях — иначе агента притянет к любому шуму.
- Оптимизация любопытства не тождественна вашей цели: проверяйте, что агент делает на самом деле, а не то, что вы предполагали.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Large-Scale Study of Curiosity-Driven Learning (Burda et al., 2018), OpenAI — Large-Scale Study of Curiosity-Driven Learning
Частые вопросы
Чем внутренняя награда отличается от внешней?
Что такое проблема шумного телевизора?
Почему случайные признаки работали так хорошо?
Можно ли применять этот подход в реальных задачах, а не в играх?
Означает ли успех в Mario, что агент действительно понимает игру?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.