
OpenAI и Microsoft переписали сделку: что изменилось
OpenAI стала публичной корпорацией во главе с фондом, а Microsoft получила долю около 27% и права на технологии до 2032 года. Разбираем, кто что выиграл и как это касается пользователей.

OpenAI стала публичной корпорацией во главе с фондом, а Microsoft получила долю около 27% и права на технологии до 2032 года. Разбираем, кто что выиграл и как это касается пользователей.

Агент, обученный на кривой функции награды, находит способ набрать очки, минуя цель. От бота, ставящего игру на паузу, до RLHF-моделей, которые учатся угождать оценщику, а не решать задачу.

Незаметный для человека шум в изображении заставляет модель уверенно ошибаться. Разбираем, как устроены adversarial-атаки, чем FGSM отличается от PGD и что реально защищает продакшн.
PixelCNN++ переписал функцию правдоподобия автогрессионных генераторов: вместо softmax на 256 значений — дискретизированная смесь логистик. Разбираем, что это даёт и как повторить.

Изменение нескольких пикселей на кадре заставляет обученного агента врезаться в стену или проиграть партию. Разбираем, как устроены атаки на политики обучения с подкреплением и почему их сложно чинить.

Робот смотрит, как задачу выполняет человек, а потом повторяет её сам — со своей камерой, своим телом и своим углом зрения. Разбираем, почему это сложнее, чем скопировать движения один в один.

Большинство конфликтов в семье и на работе — это не разница характеров, а сбой в передаче информации. Разбираем, где ломается разговор и что с этим делать на практике.

Модель, которая учится сразу на отрезках траектории вместо отдельных переходов, реже накапливает ошибку прогноза. Разбираем, где это помогает в управлении и как это устроено.

Когда нейросети учатся координироваться, они начинают придумывать собственные сигналы. Разбираем, как из простой игры в передачу сообщений рождается язык с признаками композиционности.

Классическому роботу нужны тысячи повторов, чтобы освоить действие. One-shot imitation learning обещает обучение с одной демонстрации — и это меняет экономику робототехники.

Метод, где вместо градиентов агента обучает случайный шум и естественный отбор, масштабируется на тысячи ядер почти линейно. Разбираем, где он обгоняет RL, а где проигрывает.

Те же байесовские классификаторы, что чистят почту, теперь фильтруют телефонные звонки, SMS и даже посылки на складе. Разбираем, как работает детекция спама там, где нет заголовков письма.