Iterated Amplification: как обучать ИИ задачам без готовых ответов
OpenAI предложила схему обучения, в которой человек не размечает правильные ответы напрямую, а разбивает сложную задачу на части. Разбираем, как работает iterated amplification и зачем это нужно.

Стандартное обучение с учителем упирается в простую стену: чтобы обучить модель, нужен размеченный набор данных с правильными ответами. Но для многих задач правильного ответа под рукой нет. Никто не может быстро сказать, безопасен ли фрагмент кода на миллион строк, или какое из двух долгосрочных экономических решений лучше. Схема iterated amplification (итеративное усиление), которую исследователи OpenAI описали в работе 2018 года «Supervising strong learners by amplifying weak experts», предлагает обходной путь: не давать модели готовые ответы, а собирать сигнал обучения из декомпозиции задачи на посильные части.
Проблема: где взять обучающий сигнал
Большинство успехов машинного обучения держатся на одном из двух источников сигнала. Первый — размеченные данные: человек говорит, что на картинке кошка, модель учится отличать кошек. Второй — функция вознаграждения: в игре есть счёт, и агент оптимизирует его.
Оба источника ломаются, когда задача выходит за пределы того, что человек может оценить за разумное время. Представьте, что вы просите систему спланировать транспортную реформу города. Вы не можете разметить «правильный план» — вы сами его не знаете. Вы не можете задать простую функцию вознаграждения — последствия проявятся через годы, и они многомерны.
Именно эти задачи авторы называют целями, для которых нет прямого сигнала. И именно на них рассчитан подход.
Ключевая идея: человеку не обязательно уметь решать задачу целиком. Достаточно уметь разбить её на подзадачи и собрать ответ из их решений.
Как работает iterated amplification
Схема строится на двух повторяющихся операциях — усилении (amplification) и дистилляции (distillation).
Шаг усиления
Возьмём человека-эксперта H и текущую версию модели A. Сам по себе H отвечает на сложный вопрос медленно или не может ответить вовсе. Но H способен разложить вопрос на несколько подвопросов и задать их уже обученной модели A, а затем скомбинировать полученные ответы.
Такая связка «человек плюс несколько обращений к модели» обозначается как Amplify(H, A). Она заведомо мощнее, чем одна модель A: человек добавляет структуру рассуждения, а модель — скорость на подзадачах. Это и есть «усиление слабого эксперта».
Шаг дистилляции
Связка Amplify(H, A) работает хорошо, но дорого — в ней участвует живой человек, и она медленная. Поэтому её ответы используют как обучающие примеры для новой, более сильной версии модели. Модель учится напрямую воспроизводить то, что раньше получалось только через декомпозицию с человеком.
Дальше цикл повторяется: усиленная модель снова становится помощником в декомпозиции, снова порождает более качественные ответы, снова обучается на них. По замыслу авторов, способность решать всё более сложные задачи наращивается итерациями — отсюда «iterated».
Схематично один проход выглядит так:
- Есть текущая модель A.
- Человек берёт сложный вопрос и дробит его на подвопросы.
- Подвопросы отдаются модели A, ответы собираются в итоговый ответ — это Amplify(H, A).
- Пары «вопрос — ответ от Amplify» становятся обучающими данными.
- На них обучается новая версия модели, более сильная, чем A.
- Возврат к пункту 1 с новой моделью.
Чем это отличается от привычных подходов
Ближайший родственник iterated amplification — это то, как обучались игровые системы вроде AlphaGo Zero через самоигру: там тоже система улучшается, обучаясь на результатах собственной усиленной версии. Разница в источнике сигнала.
| Подход | Откуда берётся сигнал | Ограничение |
|---|---|---|
| Обучение с учителем | Размеченные людьми ответы | Нужен готовый правильный ответ |
| Обучение с подкреплением | Функция вознаграждения | Награду нужно уметь формализовать |
| Самоигра (AlphaGo Zero) | Правила игры и исход партий | Работает там, где есть чёткие правила и результат |
| Iterated amplification | Декомпозиция задачи человеком | Нужна возможность дробить задачу на части |
Главное отличие: в самоигре сигнал приходит из внешнего мира — кто выиграл партию. В iterated amplification внешнего судьи нет. Сигнал конструируется из человеческого умения раскладывать задачу, даже когда человек не знает ответа целиком.
Зачем это исследованию безопасности ИИ
Работа выросла из повестки согласования (alignment). По мере того как модели становятся мощнее человека в отдельных областях, встаёт вопрос: как человек вообще может контролировать то, что понимает хуже системы. Если единственный способ обучать ИИ — размечать ответы, которые мы сами способны проверить, мы упираемся в потолок человеческой оценки.
Iterated amplification — попытка обойти этот потолок так, чтобы контроль оставался за человеком. Идея в том, что доверие к итоговому поведению модели наследуется из доверия к каждому маленькому шагу декомпозиции, который человек в состоянии проверить. Это делает подход частью более широкого семейства идей вместе с debate и recursive reward modeling.
Смысл не в том, чтобы человек проверял финальный ответ сверхмощной модели. Смысл в том, чтобы человек отвечал за структуру рассуждения, а не за его объём.
Что показали эксперименты и где границы
В оригинальной работе метод проверяли на алгоритмических задачах, которые естественно разбиваются на подзадачи — например, поиск кратчайшего пути в графе или объединение перестановок. На таких задачах авторы демонстрировали, что модель, обученная через амплификацию, приближается к качеству обучения на прямых ответах, но без доступа к этим прямым ответам.
Это принципиальный результат для доказательства концепции, но и его границы стоит понимать честно:
- Задачи в экспериментах хорошо декомпозируются. Реальные цели вроде «хорошей политики» дробятся куда хуже, и неочевидно, что декомпозиция сохраняет смысл.
- Ошибки могут накапливаться: если модель на подзадачах ошибается, усиленная связка наследует и усиливает ошибку.
- Подход требует, чтобы человек умел формулировать корректную декомпозицию — а это само по себе нетривиальный навык.
Actual цифры по конкретным метрикам и датасетам стоит смотреть в первоисточнике: результаты привязаны к конкретным задачам и не переносятся напрямую на произвольные домены.
Как это связано с сегодняшними моделями
Прямой продукт с надписью «iterated amplification» вы в подписке не купите. Но идея разбиения сложной задачи на проверяемые шаги и обучения на результатах такого разбиения прослеживается в более поздних работах по обучению на человеческой обратной связи и в подходах, где модель рассуждает пошагово. Концепция важна как элемент теории масштабируемого контроля, а не как готовый инструмент на каждый день.
Iterated amplification отвечает на конкретный вопрос: откуда взять обучающий сигнал, когда правильного ответа не существует ни у кого. Ответ — из человеческой способности разбивать непосильное на посильное. Насколько далеко эта идея масштабируется на действительно размытые цели, остаётся открытым вопросом.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: OpenAI: Learning complex goals with iterated amplification, Supervising strong learners by amplifying weak experts (arXiv:1810.08575)
Частые вопросы
Чем amplification отличается от distillation внутри схемы?
Это то же самое, что обучение с подкреплением на человеческой обратной связи?
Можно ли применить этот подход в своём продукте прямо сейчас?
Почему нельзя просто разметить данные вручную?
Не накапливаются ли ошибки при итерациях?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.