Шум в параметрах вместо шума в действиях: как учить агентов исследовать
OpenAI показала, что добавление шума не к действиям агента, а прямо к весам его нейросети заметно улучшает исследование среды в задачах обучения с подкреплением.

В чём проблема
Агент обучения с подкреплением учится методом проб и ошибок: пробует действия, получает награду, корректирует поведение. Но чтобы найти хорошую стратегию, ему сначала нужно наткнуться на неё случайно. Это называется исследованием (exploration), и именно оно проваливается в задачах с редкой наградой — когда полезный сигнал агент получает лишь после длинной цепочки правильных шагов.
Классический приём — добавлять случайность прямо в выбор действия. В дискретных задачах это ε-greedy: с некоторой вероятностью агент игнорирует свою политику и жмёт случайную кнопку. В непрерывном управлении к выходу сети добавляют гауссовский шум. Проблема в том, что такой шум не связан между шагами: на каждом такте он новый и независимый. Агент дёргается на месте, а не пробует новые связные линии поведения.
Идея parameter noise
OpenAI в работе Parameter Space Noise for Exploration (2017) предложила добавлять шум не к действиям, а к самим параметрам нейросети — весам, которые задают политику. Вместо того чтобы портить каждый отдельный выбор, вы один раз возмущаете всю сеть на эпизод и получаете чуть другого, но внутренне согласованного агента.
Шум в действиях делает поведение дёрганым от шага к шагу. Шум в весах делает агента другим, но целостным на протяжении всего эпизода — и именно это порождает осмысленное исследование.
Разница принципиальна. При action noise агент в одном и том же состоянии на соседних шагах может выбрать противоположные действия. При parameter noise возмущённая сеть — это детерминированная функция: в похожих состояниях она ведёт себя похоже, но иначе, чем исходная. Такое исследование напоминает целенаправленную попытку новой стратегии, а не случайное подёргивание.
Как это устроено
Метод накладывают поверх готовых алгоритмов — в статье это DQN, DDPG и TRPO. Общая схема такая:
- берётся текущая политика с весами θ;
- к весам добавляется гауссовский шум: θ' = θ + N(0, σ²);
- агент играет эпизод возмущённой сетью θ';
- перед следующим эпизодом шум генерируется заново от исходных θ.
Проблема масштаба и adaptive noise
Наивно добавить N(0, σ²) ко всем весам нельзя: разные слои по-разному чувствительны, и одна и та же σ для одного слоя — почти ноль, для другого — разрушение политики. Авторы решают это двумя приёмами.
Первый — layer normalization: нормализация внутри слоёв делает чувствительность к шуму более однородной по сети. Второй — адаптивный масштаб. Величина σ подстраивается автоматически: измеряется, насколько сильно возмущённая политика расходится с исходной в пространстве действий, и σ увеличивают или уменьшают, чтобы это расхождение держалось около целевого уровня. Так шум остаётся содержательным на всём обучении, а не выгорает и не разносит сеть.
Термин: политика
Политика (policy) — это функция, которая по текущему состоянию среды выдаёт действие или распределение над действиями. В глубоком RL её роль играет нейросеть, а обучение сводится к настройке её весов так, чтобы суммарная награда была максимальной.
Что показали эксперименты
Авторы сравнивали parameter noise с обычным action noise на трёх семействах задач: играх Atari (через DQN), непрерывном управлении в MuJoCo (DDPG и TRPO) и специально сконструированных средах с редкой наградой. Основные наблюдения:
- на большинстве задач parameter noise работает не хуже action noise, а часто заметно лучше;
- на средах с редкой наградой разрыв максимален — там, где ε-greedy почти не находит сигнала, шум в параметрах помогает наткнуться на успешную траекторию;
- метод совместим и с off-policy (DQN, DDPG), и с on-policy (TRPO) алгоритмами, то есть это не трюк под конкретную архитектуру.
Чем это отличается от эволюционных методов
Возмущение весов напоминает эволюционные стратегии, где тоже берут популяцию слегка отличающихся сетей. Но здесь шум не заменяет градиентное обучение, а дополняет его: политика по-прежнему учится обычным RL-алгоритмом на собранном опыте, а parameter noise отвечает только за то, как этот опыт собирается.
Сравнение подходов к исследованию
| Подход | Куда добавляется шум | Согласованность в эпизоде | Где силён |
|---|---|---|---|
| ε-greedy | в выбор дискретного действия | нет, шум независим по шагам | простые дискретные задачи |
| Action noise (гаусс) | в непрерывный выход сети | нет | непрерывное управление с плотной наградой |
| Parameter noise | в веса нейросети | да, весь эпизод одна возмущённая сеть | редкая награда, длинные цепочки действий |
Что с этим делать на практике
Метод несложно прикрутить к существующему коду: добавить возмущённую копию весов, отдельно нормализовать слои и подключить адаптивную подстройку σ по расхождению в пространстве действий. OpenAI выложила реализацию в составе baselines. Если ваш агент застревает на задачах с редким сигналом награды и обычная случайность в действиях не помогает — parameter noise стоит попробовать до того, как переходить к тяжёлым методам вроде curiosity-driven exploration или явных бонусов за новизну.
Стоит держать в голове: это исследовательская работа 2017 года, и с тех пор ландшафт методов исследования сильно расширился. Актуальные бенчмарки и код смотрите в оригинальной публикации и в репозиториях, а не полагайтесь на цифры из пересказов.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: OpenAI — Better Exploration with Parameter Noise (blog), Plappert et al. — Parameter Space Noise for Exploration (arXiv:1706.01905)
Частые вопросы
Чем parameter noise принципиально лучше ε-greedy?
Не разрушит ли случайный шум обученную политику?
С какими алгоритмами работает parameter noise?
Это то же самое, что эволюционные стратегии?
Где взять реализацию, чтобы попробовать самому?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.