
Как устроены стажировки OpenAI: Fellows и Interns 2019
Программы OpenAI Fellows и Interns — два разных входа в исследования ИИ. Разбираем, чем они отличались в 2019 году, кому подходили и что показывает опыт их выпускников.

Программы OpenAI Fellows и Interns — два разных входа в исследования ИИ. Разбираем, чем они отличались в 2019 году, кому подходили и что показывает опыт их выпускников.

Исследователи OpenAI запустили пятьдесят четыре агента в играх без единой внешней награды — они учились, гоняясь только за новизной. В Super Mario Bros это провело агента через 11 уровней. Разбираем, как работает curiosity-driven learning и где он ломается.

OpenAI Scholars — трёхмесячная стипендия, по итогам которой участники без опыта в ML публиковали собственные проекты. Разбираем, чему учили, какие работы вышли и что из этого модель для входа в отрасль.

Continuous normalizing flows позволяют строить обратимые генеративные модели без жёстких требований к архитектуре. FFJORD убирает главное узкое место — точный расчёт следа якобиана — и заменяет его несмещённой оценкой.

OpenAI предложила схему обучения, в которой человек не размечает правильные ответы напрямую, а разбивает сложную задачу на части. Разбираем, как работает iterated amplification и зачем это нужно.

Когда среда почти не даёт наград, обучение с подкреплением буксует. Prediction-based rewards дают агенту внутренний стимул — искать то, что он ещё не умеет предсказывать.

Модель мира учится на прошлом опыте, а планирование происходит в момент действия. Такой подход помогает роботам и агентам исследовать среду быстрее, чем классическое обучение с подкреплением.

Energy-based модели присваивают каждой комбинации данных число — энергию. Правильные сочетания получают низкую энергию, абсурдные — высокую. На этом строится способ обучать понятия без явных ярлыков.

OpenAI выложила образовательный набор Spinning Up in Deep RL: конспекты, эталонные реализации пяти алгоритмов и список статей для чтения. Разбираем, что внутри и как запустить первый алгоритм.

OpenAI закрыла первую летнюю программу Fellows финальными проектами участников. Разбираем, зачем компании такие стажировки и что это говорит о рынке входа в ИИ-исследования.

Агент, обученный проходить уровень игры без единой ошибки, проваливается на новом уровне с той же механикой. Разбираем, как исследователи научились отделять запоминание от настоящего обобщения в RL.

Каждое удвоение размера модели требует непропорционально больше данных и вычислений. Разбираем законы масштабирования: сколько это стоит и где рост упирается в потолок.