PALMS от OpenAI: как 80 текстов меняют поведение языковой модели
OpenAI показала метод PALMS: дообучение GPT-3 на выборке из 80 текстов заметно снижает токсичность ответов. Разбираем, что это за подход, где предел и почему это спорно.

OpenAI опубликовала метод, который называет PALMS — Process for Adapting Language Models to Society. Идея простая до неприличия: взять большую предобученную модель и дообучить её на крошечной, вручную собранной выборке текстов, отражающих желаемое поведение по чувствительным темам. Размер выборки — от 80 до 120 образцов, суммарно около 0,000000211% от исходного корпуса обучения GPT-3. Оценщики зафиксировали снижение токсичности ответов и сдвиг в сторону заявленных норм по девяти категориям — от насилия до отношения к меньшинствам.
Что именно сделали
Команда описала девять тем, по которым языковая модель регулярно выдаёт проблемные ответы: жестокость и угрозы, здоровье (физическое и ментальное), человеческие характеристики, несправедливость и неравенство, отношения, сексуальная активность, терроризм, вопросы о том, кого считать человеком. Для каждой темы сформулировали позицию, которую модель должна отражать, — например, «противодействовать насилию и угрозам, но допускать обсуждение исторических событий».
Дальше — вручную написали 80 текстов по 40–340 слов, каждый из которых иллюстрирует нужное поведение в формате «вопрос — развёрнутый ответ». На этой выборке дообучили GPT-3 разных размеров: от 125M параметров до 175B. Полученную модель назвали values-targeted. Для сравнения обучили ещё одну — control — на нейтральных текстах того же объёма, чтобы отделить эффект самого дообучения от эффекта содержания.
Результаты в цифрах
Оценивали двумя способами: люди-разметчики ставили ответам оценку от 1 до 5 по соответствию заявленной позиции, а автоматический классификатор Perspective API мерил токсичность.
| Модель | Оценка соответствия (1–5) | Токсичность (Perspective API) |
|---|---|---|
| Base GPT-3, 175B | ~3,0 | базовый уровень |
| Control, 175B | близко к base | близко к base |
| Values-targeted, 175B | ~4,0 | ниже на ~30% |
Эффект растёт с размером модели: на маленьких вариантах разница между values-targeted и control почти неразличима, на 175B — становится заметной. Это ровно обратное тому, чего можно было ожидать: большие модели не «упираются» в свои привычки, а лучше усваивают тонкую подстройку.
Почему это важно
Обычный сценарий выравнивания поведения — это либо фильтры на выходе, либо RLHF с десятками тысяч сравнений, либо переобучение с нуля на очищенном корпусе. Всё это дорого. PALMS показывает, что для сдвига по узкому набору тем достаточно нескольких десятков хорошо написанных примеров и одной сессии дообучения.
Величина корпуса дообучения — меньше одной миллионной процента от исходного корпуса. И этого хватает, чтобы устойчиво изменить поведение модели по девяти чувствительным темам.
Практический вывод для тех, кто работает с открытыми моделями: если у вас Llama или Qwen и вы хотите, чтобы ассистент вёл себя определённым образом в узкой предметной области, вам не нужен датасет на миллион примеров. Нужен аккуратно написанный набор из сотни-другой качественных образцов.
Что в этом спорного
- Кто пишет «правильные» ответы. В PALMS позиции по темам сформулировали сотрудники OpenAI. Их «противодействовать несправедливости» — это чьё именно понимание справедливости? В документе это признаётся прямо: values-targeted означает «выровненный под ценности авторов», а не «универсально этичный».
- Оценка своими же критериями. Разметчики оценивали ответы по тем же нормам, на которых модель дообучали. Улучшение по своей же метрике — не то же самое, что улучшение поведения.
- Узкий срез. Девять тем — это не «поведение модели вообще». По всему, что за пределами списка, модель ведёт себя как раньше.
- Хрупкость. Небольшая выборка легко перебивается противоположным дообучением. Тот, кто хочет получить «расторможенную» версию, потратит на это те же 80 примеров.
Как это устроено технически
Формат обучающего примера — обычный текст в стиле промпт-ответ, без специальных токенов. Пример структуры (упрощённо):
Q: Почему некоторые люди в тюрьмах?
A: Люди попадают в тюрьму по разным причинам,
некоторые из которых справедливы, а некоторые — нет.
В США тюремная система непропорционально затрагивает
чернокожих и латиноамериканцев. [...продолжение с фактами...]Дообучение идёт стандартным causal LM loss, никаких reward-моделей и RL. Стоимость такого прогона на 175B по прикидкам — единицы тысяч долларов; на моделях уровня 7B это десятки долларов на арендованном GPU. Для сравнения: полноценный RLHF-цикл с разметкой сравнений обходится в сотни тысяч долларов и месяцы работы.
Где предел
PALMS не делает модель «безопасной». Он смещает распределение ответов по конкретным темам в конкретную сторону. Модель по-прежнему галлюцинирует, ошибается в фактах и может обойти установки при достаточно изобретательном промпте. Это инструмент подстройки, а не решение проблемы выравнивания.
Что забрать с собой
- Малые курируемые выборки работают — если они действительно курируемые. 80 текстов, написанных с пониманием задачи, бьют 80 000 автоматически собранных.
- Эффект растёт с размером модели, а не падает. Это меняет экономику дообучения: имеет смысл вкладываться в качество примеров, а не в объём.
- Метод переносим на любые открытые LLM. Всё, что нужно, — сформулировать желаемое поведение и написать примеры.
- Оценка результата — отдельная задача. Мерить успех той же линейкой, которой размечали данные, — путь к самообману.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Improving language model behavior by training on a curated dataset — OpenAI, Process for Adapting Language Models to Society (PALMS) — arXiv
Частые вопросы
Можно ли применить PALMS к открытым моделям вроде Llama или Mistral?
Чем PALMS отличается от RLHF?
Сколько примеров нужно для собственной адаптации?
Работает ли метод на маленьких моделях до 1B параметров?
Можно ли этим методом заставить модель говорить неправду или продвигать конкретную идеологию?
Сохраняются ли общие способности модели после PALMS?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.