RLHF: как модели учат угадывать, что вам нравится
Обучение на человеческих предпочтениях превратило сырую языковую модель в ChatGPT. Разбираем, как работает RLHF, чем его заменяют DPO и RLAIF и сколько стоит собрать разметку предпочтений.

В 2017 году исследователи OpenAI и DeepMind опубликовали работу «Deep Reinforcement Learning from Human Preferences», где агент учился делать сальто в симуляторе, не получая ни одной формулы награды — только ответы человека на вопрос «какой из двух роликов лучше». Человеку показали примерно 900 пар коротких видео, он тыкал в лучшее, и этого хватило, чтобы обучить поведение, которое почти невозможно описать функцией награды вручную. Спустя пять лет тот же приём — обучение на предпочтениях — превратил GPT-3, модель, которая охотно продолжала текст любым правдоподобным способом, в ChatGPT, который старается отвечать полезно и не грубить.
Зачем вообще спрашивать человека
Языковая модель после предобучения умеет одно: предсказывать следующий токен по гигантскому корпусу текста. Она одинаково правдоподобно продолжит и рецепт, и инструкцию по изготовлению чего-то опасного, и вежливый ответ, и хамство — потому что всё это встречалось в интернете. Проблема не в том, что модель «не знает», а в том, что у неё нет представления, какой из миллиона допустимых ответов вы хотите получить.
Написать функцию, которая оценивает «полезность» и «безвредность» ответа формулой, невозможно: эти понятия живут в головах людей, а не в коде. Отсюда идея — не описывать желаемое поведение, а показывать его на примерах сравнений. Человеку проще сказать «вот этот ответ лучше того», чем сформулировать правило, по которому он это решил.
Люди плохо формулируют, чего хотят, но хорошо узнают это, когда видят. Обучение на предпочтениях строится именно на второй способности, а не на первой.
Как устроен RLHF по шагам
Классический пайплайн RLHF1 из работы OpenAI «InstructGPT» (2022) состоит из трёх этапов, и каждый решает свою задачу.
- SFT — дообучение на демонстрациях. Разметчики пишут эталонные ответы на запросы, и модель дообучают на них обычным обучением с учителем. Это задаёт формат и тон, но не масштабируется: писать хорошие ответы дорого.
- Обучение модели награды. Модель генерирует несколько ответов на один запрос, человек ранжирует их от лучшего к худшему. На этих сравнениях обучают отдельную reward-модель, которая выдаёт числовую оценку любому ответу.
- Оптимизация политики. Основную модель дообучают алгоритмом обучения с подкреплением (чаще всего PPO), чтобы она максимизировала оценку reward-модели. Одновременно её штрафуют за слишком сильное отклонение от исходной версии — иначе она находит способы «взломать» награду и начинает выдавать бессмыслицу, которую reward-модель почему-то любит.
Третий шаг — самый хрупкий. Reward-модель — это приближение человеческих вкусов, и стоит политике начать её эксплуатировать, как качество ответов для реального человека падает, хотя цифры растут. Это называют reward hacking, и борьба с ним занимает значительную часть инженерной работы.
DPO: то же самое без обучения с подкреплением
PPO капризен: много гиперпараметров, нестабильное обучение, нужна отдельная reward-модель в памяти. В 2023 году исследователи из Стэнфорда предложили DPO (Direct Preference Optimization) — способ обучать модель прямо на парах «лучший ответ / худший ответ», без отдельной reward-модели и без RL-цикла. Математически DPO показывает, что задачу оптимизации политики можно переписать как обычную классификационную функцию потерь на предпочтениях.
На практике DPO проще запустить и воспроизвести, поэтому он быстро стал стандартом в открытых проектах. RLHF на PPO при этом не исчез — у крупных лабораторий он даёт больше контроля, особенно когда предпочтений много и они противоречат друг другу.
А если разметку делает не человек
Сбор человеческих сравнений — узкое место: это дорого и медленно. RLAIF (Reinforcement Learning from AI Feedback) заменяет разметчика другой моделью, которая сравнивает ответы по заданному набору принципов. Anthropic развила это в подход Constitutional AI: модель критикует и переписывает собственные ответы, опираясь на короткий текстовый «свод правил», а человек участвует минимально. Экономия очевидна, риск тоже — предвзятость модели-судьи прямиком переезжает в обучаемую модель.
Чем методы отличаются на практике
| Подход | Кто даёт сигнал | Нужна reward-модель | Сложность запуска |
|---|---|---|---|
| RLHF (PPO) | Человек ранжирует ответы | Да | Высокая |
| DPO | Человек, пары предпочтений | Нет | Средняя |
| RLAIF / Constitutional AI | Модель-судья по правилам | Зависит от реализации | Средняя |
Точные цифры затрат сильно зависят от задачи и качества разметки, поэтому конкретных сумм здесь не будет — но порядок понятен: человеческая разметка предпочтений измеряется десятками тысяч сравнений и оплачивается почасово, тогда как AI-обратная связь ограничена в основном стоимостью инференса модели-судьи.
Где обучение на предпочтениях ломается
Метод переносит в модель вкусы конкретной группы разметчиков со всеми их ограничениями. Несколько типичных проблем:
- Смещение к длине и уверенности. Разметчики часто выбирают более длинные и уверенно звучащие ответы, и модель учится быть многословной и категоричной, даже когда не должна.
- Sycophancy — угодливость. Модель склоняется к тому, чтобы соглашаться с пользователем, потому что согласие чаще получало высокую оценку.
- Противоречивые предпочтения. Разные люди хотят разного, и усреднённая награда не устраивает никого полностью.
- Reward hacking. Политика находит лазейки в reward-модели и оптимизирует их вместо реального качества.
Ни один из этих дефектов не лечится добавлением данных «в лоб» — они встроены в саму идею учиться на том, что людям нравится в моменте, а не на том, что объективно верно.
1 RLHF (Reinforcement Learning from Human Feedback) — обучение модели с подкреплением, где сигналом награды служат человеческие сравнения ответов, а не заранее заданная формула.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: OpenAI — Learning from human preferences, Ouyang et al. — Training language models to follow instructions with human feedback (InstructGPT)
Частые вопросы
Чем RLHF отличается от обычного дообучения на примерах?
Почему нельзя просто написать функцию награды вручную?
DPO полностью заменяет RLHF на PPO?
Что такое sycophancy и почему это проблема?
Насколько надёжна обратная связь от другой модели (RLAIF)?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.