
PPO: почему этот алгоритм обучает почти всё — от ботов до ChatGPT
Proximal Policy Optimization стал стандартом обучения с подкреплением: на нём OpenAI обучала манипуляторы, игровых ботов и этап RLHF в ChatGPT. Разбираем, как он устроен и почему вытеснил конкурентов.










