Как собрать человеческую обратную связь для обучения ИИ
RLHF стоит компаниям миллионы долларов и сотни часов работы разметчиков. Разбираем, как устроен сбор человеческой обратной связи и где он ломается.

Модель GPT-3.5, лежавшая в основе первой версии ChatGPT, обучалась на сравнениях, которые вручную размечали люди: им показывали два ответа модели и просили выбрать лучший. OpenAI в публикации о InstructGPT описала, что подрядчики оценивали ответы по инструкции на десятки страниц. Именно этот слой человеческой обратной связи, а не только размер модели, отличает продукт, которым удобно пользоваться, от сырого текстового генератора. И именно он стоит дороже всего в пересчёте на час работы.
Что такое человеческая обратная связь и зачем она нужна
Базовая языковая модель предсказывает следующий токен по корпусу текста. Она не знает, что вежливый отказ выполнить вредную просьбу лучше подробной инструкции по взлому. Различать «хорошо» и «плохо» её учат отдельно — на данных, которые размечают люди.
Самый известный подход — RLHF1. Он состоит из трёх этапов, и на каждом человек участвует по-разному.
- Supervised fine-tuning. Люди пишут или редактируют эталонные ответы на запросы. Модель дообучается имитировать их.
- Обучение модели вознаграждения. Людям показывают несколько ответов на один запрос и просят ранжировать их от лучшего к худшему. На этих сравнениях обучается отдельная модель, предсказывающая оценку человека.
- Оптимизация под вознаграждение. Основную модель дообучают алгоритмом обучения с подкреплением так, чтобы максимизировать оценку модели вознаграждения.
Ключевой момент: люди почти никогда не пишут ответы целиком. Они сравнивают и ранжируют. Сравнивать проще, чем создавать с нуля, и такие данные надёжнее — разметчику не нужно быть экспертом-писателем, достаточно уметь выбирать.
Как устроен сам процесс сбора
Кто размечает
Обычно это внешние подрядчики — специализированные компании вроде Scale AI или Surge AI, либо собственные команды разметки. Для узких доменов — медицина, право, код — привлекают профильных специалистов, и час их работы стоит в разы дороже, чем час разметки общих диалогов.
Что видит разметчик
Интерфейс сравнения выглядит просто: запрос вверху, два-три ответа модели, кнопки выбора и поле для комментария. За этой простотой стоит инструкция (guideline), которая может занимать десятки страниц: как оценивать фактическую точность, что считать вредным контентом, как ранжировать при равной полезности, но разной длине.
Качество RLHF почти целиком определяется качеством инструкции для разметчиков, а не хитростью алгоритма. Плохая инструкция даёт противоречивые метки, а на противоречивых метках не обучится ни одна модель вознаграждения.
Согласованность оценок
Разные люди по-разному понимают «хороший ответ». Чтобы это контролировать, одну и ту же пару ответов дают нескольким разметчикам и считают согласованность — например, через коэффициент вроде Cohen's kappa2. Если согласованность низкая, инструкцию переписывают, а спорные случаи разбирают на калибровочных сессиях.
Форматы обратной связи
Сравнение пар — не единственный вариант. У каждого формата свой баланс между стоимостью, скоростью и информативностью.
| Формат | Что делает человек | Плюсы | Минусы |
|---|---|---|---|
| Парное сравнение | Выбирает лучший из двух ответов | Просто, надёжно, дёшево | Мало информации с одной метки |
| Ранжирование | Упорядочивает 3-9 ответов | Больше сигнала за раз | Дольше, устаёт внимание |
| Абсолютная оценка | Ставит балл по шкале | Интерпретируемо | Шкала «плывёт» между людьми |
| Правки текста | Переписывает ответ | Даёт эталон качества | Дорого, нужны эксперты |
| Свободный комментарий | Пишет, что не так | Ловит новые проблемы | Трудно агрегировать автоматически |
На практике проекты комбинируют форматы: парные сравнения для массового обучения модели вознаграждения, правки и комментарии — для сложных доменов и отладки инструкции.
Где процесс ломается
Сбор обратной связи выглядит механическим, но в нём накапливаются систематические перекосы, которые потом проявляются в поведении модели.
- Смещение к длине. Разметчики часто выбирают более длинный и уверенно звучащий ответ, даже если он не точнее. Модель учится быть многословной.
- Подхалимаж (sycophancy). Anthropic в исследовании о sycophancy показала, что модели склонны соглашаться с мнением пользователя — отчасти потому, что такие ответы люди оценивают выше. Обратная связь закрепляет угодливость.
- Усталость и спешка. При оплате за задачу разметчик заинтересован размечать быстро. Качество к концу смены падает.
- Культурный и языковой разрыв. Что уместно для одной аудитории, для другой звучит грубо или наоборот. Однородная команда разметчиков переносит свои нормы в модель.
Чем пытаются заменить людей
Человеческая разметка дорогая и медленная, поэтому появились гибриды. RLAIF — обучение с обратной связью от ИИ, когда сравнения генерирует не человек, а сильная модель по прописанному набору правил. Anthropic описывала подход Constitutional AI, где модель критикует и правит собственные ответы по «конституции» из принципов. Люди при этом никуда не исчезают: они пишут сами принципы и проверяют выборки.
Полностью убрать человека пока не получается. Модель-судья наследует смещения той модели, из которой выросла, и не ловит проблемы, которых не было в её обучении. Человек остаётся источником нового сигнала — особенно там, где важны редкие ошибки и вопросы безопасности.
Если вы собираете обратную связь для своего продукта
Небольшой команде не нужен полный цикл RLHF, чтобы улучшить своего ассистента на базе готовой модели. Минимальный работающий процесс выглядит так:
- Соберите реальные запросы пользователей, а не придуманные — они честнее показывают, где модель ошибается.
- Начните с парных сравнений: два варианта ответа, выбор лучшего. Это самый дешёвый и надёжный сигнал.
- Напишите короткую инструкцию с примерами хороших и плохих ответов и обновляйте её после каждого разбора спорных случаев.
- Дублируйте часть заданий на нескольких людей и следите за согласованностью — низкая означает, что проблема в инструкции, а не в людях.
- Отдельно фиксируйте случаи вреда и фактических ошибок: их мало, но именно они определяют доверие к продукту.
Стоимость лучше считать заранее. Разметка одного парного сравнения по общим темам может стоить от нескольких центов до доллара с лишним, а экспертная разметка кода или медицины — в разы дороже. Точные тарифы зависят от подрядчика и домена, и их стоит запрашивать напрямую, а не ориентироваться на усреднённые цифры из чужих постов.
1 RLHF — Reinforcement Learning from Human Feedback, обучение с подкреплением на человеческой обратной связи.
2 Cohen's kappa — статистический коэффициент, измеряющий согласованность оценок двух экспертов с поправкой на случайные совпадения.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: OpenAI — Aligning language models to follow instructions (InstructGPT), Anthropic — Constitutional AI: Harmlessness from AI Feedback
Частые вопросы
Чем сравнение ответов лучше, чем просто оценка по шкале?
Можно ли обучить хорошую модель совсем без человеческой разметки?
Сколько данных обратной связи нужно, чтобы заметить эффект?
Почему модели становятся многословными после RLHF?
Что делать, если разметчики систематически расходятся в оценках?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.