
Нейрон настроения: как сеть сама нашла тональность текста
OpenAI в 2017 году обучала модель просто предсказывать следующий символ в отзывах Amazon — а внутри неё сам собой возник один нейрон, отвечающий за позитив и негатив.

OpenAI в 2017 году обучала модель просто предсказывать следующий символ в отзывах Amazon — а внутри неё сам собой возник один нейрон, отвечающий за позитив и негатив.

Стохастические нейросети (SNN) с шумом на скрытом слое учат политику низкого уровня набирать разнообразные навыки без явной награды, а затем менеджер комбинирует их под конкретную задачу.

За entropy-регуляризованным RL стоит математический факт: градиент политики и мягкий Q-learning оптимизируют один и тот же критерий и в пределе дают одну и ту же политику. Разбираем, откуда берётся эквивалентность и что она даёт на практике.

Google DeepMind, Nvidia и стартапы вроде Physical Intelligence переносят подход больших языковых моделей на роботов. Итог — машины, которые складывают бельё и открывают ящики без ручного программирования под каждую задачу.

Репозиторий OpenAI Baselines давно заморожен, а его DQN всё ещё копируют в туториалах. Разбираемся, что реально работает, где грабли и чем заменить в 2024 году.

Обучение на человеческих предпочтениях превратило сырую языковую модель в ChatGPT. Разбираем, как работает RLHF, чем его заменяют DPO и RLAIF и сколько стоит собрать разметку предпочтений.

Ансамбль из нескольких Q-сетей превращает разброс их оценок в бонус за исследование. Разбираем, как это работает на практике и чем отличается от epsilon-greedy.

Одиночная нейросеть отвечает на вопрос. Несколько агентов в одной среде начинают вести себя иначе: договариваться, обманывать и делить ресурсы. Разбираем, чему на самом деле учатся мультиагентные системы.

Наивный цикл интегрирования N тел на чистом Python считает секунды там, где NumPy справляется за миллисекунды. Разбираем, где Python теряет скорость и чем это лечится.

Дистилляция знаний и curriculum learning дают связку: сильная модель-учитель размечает и упорядочивает данные, а компактный студент учится быстрее и дешевле. Разбираем, где это работает, а где ломается.

В разреженных наградах агент может миллионы шагов не получать ни одного положительного сигнала. HER переписывает цель постфактум и превращает неудачные эпизоды в обучающие примеры.

Изменение одного знака в изображении переворачивает предсказание нейросети. Разбираем, что такое устойчивые состязательные примеры, чем они опасны в проде и как их ловить.