
Как обучение без учителя изменило языковые модели
Предобучение на неразмеченном тексте вытеснило подход, где каждую задачу тренировали отдельно на размеченных данных. Разбираем, почему это сработало и что это меняет на практике.

Предобучение на неразмеченном тексте вытеснило подход, где каждую задачу тренировали отдельно на размеченных данных. Разбираем, почему это сработало и что это меняет на практике.

Агентные модели всё чаще действуют не в одиночку, а рядом с другими агентами. Чтобы предсказывать их поведение, исследователи учат нейросети сжимать чужую политику в вектор — и работать с ним как с обычным эмбеддингом.

OpenAI провела соревнование, где алгоритмы обучались проходить незнакомые уровни Sonic the Hedgehog. Победитель набрал далеко не идеальный результат — и это главный вывод конкурса о слабости обобщения в обучении с подкреплением.

OpenAI показала метод, который обучает агента играм с редкой наградой всего по одной человеческой записи. На Montezuma’s Revenge агент набрал больше 74 000 очков — там, где обычный RL застревал на нуле.

Glow — потоковая модель от OpenAI, которая генерирует лица и умеет ровно то, чего не могут GAN: считать точную вероятность любого изображения и обратимо кодировать его в латентное пространство.

OpenAI запустила программу Scholars, чтобы за несколько месяцев переучить людей из смежных областей в исследователей машинного обучения. Разбираем, как устроен формат, кому он подходит и чем полезен всем остальным.

Алгоритмы вроде VIC, DIAYN и VALOR учат агента набору различимых навыков без единой внешней награды — за счёт взаимной информации между навыком и поведением. Разбираем, как это работает и где ломается.

Роботы научились бегать и делать сальто, но до сих пор роняют кубик и не могут завязать шнурки. Разбираем, почему ловкость кисти — нерешённая задача и что меняют обучение с подкреплением и симуляции.

Программы OpenAI Fellows и Interns — два разных входа в исследования ИИ. Разбираем, чем они отличались в 2019 году, кому подходили и что показывает опыт их выпускников.

Исследователи OpenAI запустили пятьдесят четыре агента в играх без единой внешней награды — они учились, гоняясь только за новизной. В Super Mario Bros это провело агента через 11 уровней. Разбираем, как работает curiosity-driven learning и где он ломается.

OpenAI Scholars — трёхмесячная стипендия, по итогам которой участники без опыта в ML публиковали собственные проекты. Разбираем, чему учили, какие работы вышли и что из этого модель для входа в отрасль.

Continuous normalizing flows позволяют строить обратимые генеративные модели без жёстких требований к архитектуре. FFJORD убирает главное узкое место — точный расчёт следа якобиана — и заменяет его несмещённой оценкой.