
Evolved Policy Gradients: когда RL сам придумывает функцию потерь
OpenAI показала метод, где алгоритм обучения с подкреплением не задаётся вручную, а эволюционирует. Агент учится по функции потерь, которую подобрал внешний цикл — и переносит навык на задачи, которых не видел.










