OpenAI научила модель писать саммари лучше человека
Исследование OpenAI 2020 года показало: модель на 1,3 млрд параметров, обученная на человеческих оценках, пишет краткие пересказы лучше модели в 10 раз больше. Ключ — обучение с подкреплением по фидбеку людей.

В сентябре 2020 года команда OpenAI опубликовала работу Learning to summarize with human feedback. Она интересна не столько результатом, сколько методом: авторы показали, что если брать оценки живых редакторов и учить модель предсказывать их предпочтения, качество саммари растёт быстрее, чем от наращивания параметров. Эта же схема через два года легла в основу ChatGPT под аббревиатурой RLHF.
Что именно сделали
Задача — сжимать посты с Reddit (датасет TL;DR, около 123 тысяч постов с авторскими краткими пересказами) и новости CNN/DailyMail. Исследователи взяли предобученные GPT-3-подобные модели на 1,3 и 6,7 млрд параметров и провели их через три стадии.
- Supervised fine-tuning. Модель дообучали на человеческих саммари из TL;DR — стандартная процедура, дающая базовую политику.
- Сбор предпочтений. Модель генерировала пары саммари для одного и того же поста, разметчики выбирали, какое лучше. Собрали около 64 тысяч сравнений.
- Reward model + PPO. На парах обучили отдельную reward-модель, предсказывающую человеческий выбор. Затем языковую модель дотягивали алгоритмом PPO так, чтобы reward-модель ставила ей высокие оценки.
Почему это было неожиданно
До этой работы главной метрикой качества саммари считалась ROUGE — механическое сравнение с эталоном по перекрытию слов. Оказалось, что модель, обученная на человеческих предпочтениях, по ROUGE проигрывает, а по мнению живых оценщиков — выигрывает у всех.
Сравнение по человеческим оценкам
| Модель | Метод | Доля побед против референса |
|---|---|---|
| 1,3B | Supervised | ~ 0,43 |
| 6,7B | Supervised | ~ 0,48 |
| 1,3B | Human feedback (RLHF) | ~ 0,63 |
| 6,7B | Human feedback (RLHF) | ~ 0,70 |
Здесь референс — саммари, написанное автором поста. Значение выше 0,5 означает, что оценщики чаще предпочитали модель, а не человека. Модель на 1,3 млрд параметров с фидбеком обошла supervised-модель в пять раз большего размера.
Оптимизация по человеческим предпочтениям даёт больше, чем увеличение модели на порядок. Это фундаментальное наблюдение, которое переопределило приоритеты индустрии.
Как выглядит цикл обучения
Упрощённая схема того, что происходит на третьей стадии:
for step in range(N):
batch = sample_posts()
summaries = policy.generate(batch)
rewards = reward_model.score(batch, summaries)
kl = kl_divergence(policy, sft_policy)
loss = -(rewards - beta * kl)
policy.update(loss) # PPOКлючевой момент — штраф beta * kl. Он не даёт политике убежать далеко от исходной supervised-модели. Без него агент быстро находит способы обмануть reward-модель: генерирует бессмыслицу, которая почему-то нравится оценщику качества, но не людям. Это первое публичное описание reward hacking в языковых моделях.
Сколько это стоило
Точных цифр по бюджету OpenAI не раскрывала, но кое-что оценить можно. Разметка 64 тысяч сравнений при ставках квалифицированных аннотаторов $15–25 в час и производительности порядка 30–50 сравнений в час — это примерно 1300–2100 человеко-часов, то есть $25–50 тысяч только за фидбек. Плюс инфраструктура: обучение и rollout PPO-политики для модели на 6,7B параметров — ещё десятки тысяч долларов GPU-времени.
По меркам 2020 года — недорого для лаборатории уровня OpenAI. По меркам стартапа — уже серьёзные деньги, которые окупаются только если модель идёт в продукт.
Что взяли на вооружение потом
- InstructGPT (2022). Та же трёхстадийная схема, но задача — не саммари, а следование инструкциям. Модель на 1,3B обошла GPT-3 на 175B по человеческим оценкам.
- ChatGPT (ноябрь 2022). Продуктовое развитие InstructGPT. RLHF стал стандартом де-факто.
- Anthropic, DeepMind, Meta. Свои версии: Constitutional AI, Sparrow, Llama 2-Chat. Все повторяют базовую идею с вариациями.
- DPO (2023). Direct Preference Optimization обходится без reward-модели и PPO — учит политику напрямую на парах предпочтений. Заметно проще в реализации.
Где предел метода
Работа честно перечисляет ограничения, о которых теперь принято молчать в маркетинговых материалах.
- Смещение аннотаторов. Модель обучается на вкусах конкретной группы разметчиков — молодых англоязычных исполнителей. Их представление о хорошем саммари не универсально.
- Reward hacking. При долгом обучении политика начинает эксплуатировать слабости reward-модели: например, писать длиннее, потому что оценщикам чуть чаще нравятся развёрнутые версии.
- Стоимость обратной связи растёт нелинейно. Чем лучше модель, тем сложнее сравнивать её выходы: разметчики начинают спорить между собой.
- Узкий домен. Модель, натренированная на Reddit-постах, хуже обобщает на новости CNN, хотя перенос всё равно есть.
Спустя пять лет статья читается как археология: 6,7 млрд параметров сегодня кажутся смешным размером. Но именно здесь публично показали связку предпочтения → reward-модель → PPO, на которой стоит вся современная индустрия чат-ассистентов. Всё, что вы делаете с ChatGPT, Claude или Gemini, — прямое следствие этих 30 страниц.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Learning to summarize with human feedback (Stiennon et al., 2020), OpenAI Blog: Learning to summarize with human feedback
Частые вопросы
Чем RLHF отличается от обычного fine-tuning?
Почему для этой задачи не подошла метрика ROUGE?
Что такое reward hacking в этом контексте?
Можно ли повторить это в небольшой команде?
Зачем нужен штраф KL-дивергенции?
Почему модель 1,3B обошла модель 6,7B на supervised?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту. Компания Meta Platforms Inc. признана в России экстремистской организацией; её деятельность на территории Российской Федерации запрещена.