
Hindsight Experience Replay: как учить агента на провалах
В разреженных наградах агент может миллионы шагов не получать ни одного положительного сигнала. HER переписывает цель постфактум и превращает неудачные эпизоды в обучающие примеры.

В разреженных наградах агент может миллионы шагов не получать ни одного положительного сигнала. HER переписывает цель постфактум и превращает неудачные эпизоды в обучающие примеры.

Изменение одного знака в изображении переворачивает предсказание нейросети. Разбираем, что такое устойчивые состязательные примеры, чем они опасны в проде и как их ловить.

Proximal Policy Optimization стал стандартом обучения с подкреплением: на нём OpenAI обучала манипуляторы, игровых ботов и этап RLHF в ChatGPT. Разбираем, как он устроен и почему вытеснил конкурентов.

Каждый матч Dota 2 оставляет след в открытых данных: пики, урон, тайминги. Разбираем, как вытащить эту статистику через OpenDota API и не упереться в лимиты запросов.

OpenAI показала, что добавление шума не к действиям агента, а прямо к весам его нейросети заметно улучшает исследование среды в задачах обучения с подкреплением.

RLHF стоит компаниям миллионы долларов и сотни часов работы разметчиков. Разбираем, как устроен сбор человеческой обратной связи и где он ломается.

OpenAI выложила в набор Baselines две реализации policy-gradient алгоритмов — A2C и ACKTR. Первый проще и быстрее считает шаг, второй тратит больше на математику ради лучшей выборки данных.

Обычные обучающиеся агенты в играх вроде «дилеммы заключённого» скатываются к взаимному предательству. LOLA — метод, где агент моделирует, как его действия меняют обучение оппонента, и это выводит систему к сотрудничеству.

Мета-обучение обещает роботам и алгоритмам умение осваивать новый борцовский приём за десятки повторов, а не за сотни тысяч. Разбираем, что за этим стоит и где заканчивается хайп.

Способность предсказывать намерения другого агента — старая задача из психологии, которую теперь решают внутри нейросетей. Разбираем, что такое машинная «теория разума» и где она уже ломается.

Сеть без единой функции активации по определению вычисляет только линейные функции входа. Но при обучении градиентным спуском она ведёт себя так, будто нелинейность у неё есть — и это ломает наивную интуицию.

Обучение через игру с собственными копиями вывело агентов на сверхчеловеческий уровень в го, шахматах и Dota 2. Разбираем, как работает self-play, где он ломается и сколько это стоит.