Иерархия навыков: как ИИ учится собирать большое из малого
Иерархическое обучение — когда модель осваивает не одно длинное действие, а набор коротких навыков и учится их комбинировать. Разбираем, зачем это нужно и где ломается.

Представьте задачу: робот должен приготовить кофе. Если учить его этому как одному непрерывному потоку из тысяч движений, обучение растягивается на миллионы попыток, а любая мелкая ошибка в середине рушит весь эпизод. Иерархический подход разбивает задачу иначе: сначала модель осваивает короткие навыки — взять чашку, налить воду, нажать кнопку, — а поверх них учится политика более высокого уровня, которая решает, какой навык и когда запускать. Это и есть learning a hierarchy: обучение не одному действию, а структуре из вложенных действий.
Почему плоское обучение упирается в потолок
Классическое обучение с подкреплением работает с горизонтом планирования: сколько шагов вперёд агент должен связать между собой, чтобы получить награду. Чем длиннее горизонт, тем реже случайное поведение натыкается на успех и тем слабее сигнал, по которому можно чему-то научиться.
На длинных задачах это превращается в проблему разреженной награды1. Агент делает сотни шагов, награда приходит один раз в конце, и понять, какое именно действие в цепочке было полезным, почти невозможно. Иерархия сокращает эффективный горизонт: политика верхнего уровня оперирует не отдельными движениями, а навыками, каждый из которых уже стоит десятков низкоуровневых шагов.
Иерархия не делает задачу проще. Она делает её короче для того уровня, который принимает решения — а это часто и есть всё, чего не хватало.
Из чего состоит иерархия
Типичная двухуровневая схема выглядит так:
- Нижний уровень (навыки, или опции) — короткие политики, которые решают одну подзадачу: пройти в точку, схватить предмет, повернуть. Каждый навык запускается, работает несколько шагов и завершается.
- Верхний уровень (менеджер, или мета-политика) — выбирает, какой навык активировать сейчас, исходя из общей цели. Он не двигает суставами робота напрямую, он дирижирует.
Ключевая идея, которая проходит через большинство подходов: навыки сначала предобучаются, а потом переиспользуются на новых задачах без обучения с нуля. Именно это дало иерархии второе дыхание в работах вокруг метода Meta-Learning Shared Hierarchies и родственных ему — идея в том, чтобы найти набор навыков, полезный сразу для семейства задач, а не для одной.
Три способа, откуда берутся навыки
Главный вопрос иерархического обучения — не как комбинировать навыки, а откуда их взять. Здесь конкурируют несколько подходов, и у каждого своя цена.
| Подход | Как получают навыки | Слабое место |
|---|---|---|
| Ручная разметка | Инженер задаёт подцели заранее (дойти до двери, открыть) | Не масштабируется, требует знания задачи |
| Обучение из данных | Навыки выделяют из демонстраций или прошлого опыта | Нужен большой и разнообразный набор траекторий |
| Без учителя | Агент сам ищет разнообразные повторяемые поведения | Полезность навыков не гарантирована |
Подход без учителя — самый амбициозный. Агент максимизирует не внешнюю награду, а разнообразие и различимость своих собственных поведений: он старается научиться навыкам, которые заметно отличаются друг от друга и предсказуемо приводят в разные состояния. Идея красивая, но на практике часто рождает навыки, которые красиво выглядят на графике и бесполезны в деле.
Проблема несогласованных уровней
Самая коварная сложность иерархии в том, что два уровня учатся одновременно и мешают друг другу. Пока менеджер учится выбирать навыки, сами навыки ещё меняются под ним. Менеджер строит стратегию на основе навыка, который через сотню обновлений будет вести себя иначе. Это делает обучение нестабильным, и значительная часть исследований посвящена именно тому, как заморозить нижний уровень, пока учится верхний, и наоборот.
Где иерархия реально выигрывает
Иерархический подход оправдан не всегда. Он окупается там, где выполняются условия:
- Длинный горизонт. Задача требует связать много шагов, и плоский агент тонет в разреженной награде.
- Переиспользование. Есть семейство похожих задач, где одни и те же навыки нужны снова и снова. Навык навигации полезен и для доставки, и для патрулирования.
- Естественная модульность. Задачу можно осмысленно разбить на подзадачи — это верно для робототехники и навигации и почти неверно для задач, где действия слитны.
Если задача короткая или монолитная, иерархия добавляет накладные расходы и лишние параметры, ничего не давая взамен. Двухуровневая архитектура сама по себе не магия — это ставка на структуру, и она проигрывает, когда структуры в задаче нет.
Иерархия навыков и большие модели
Тема получила новое звучание с приходом языковых моделей и агентов. Когда LLM разбивает большую задачу на подзадачи и вызывает инструменты, это по сути та же иерархия: модель верхнего уровня планирует, а отдельные вызовы функций играют роль навыков. Разница в том, что навыки здесь не обучаются с нуля через награду, а задаются как готовые инструменты или подсказки.
Это сместило акцент. Раньше главной болью было выучить навыки; теперь навыки часто уже есть — в виде API, функций, других моделей, — и главным становится научить верхний уровень грамотно их вызывать и восстанавливаться после ошибки нижнего. Идея вложенности осталась, изменился слой, где идёт основное обучение.
1 Разреженная награда — ситуация, когда агент получает сигнал об успехе редко и с задержкой (например, только в конце эпизода), а не после каждого действия. Из-за этого трудно понять, какие именно действия привели к результату.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Meta-Learning Shared Hierarchies (OpenAI)
Частые вопросы
Чем иерархическое обучение отличается от обычного обучения с подкреплением?
Что такое опции (options) в этом контексте?
Всегда ли иерархия лучше плоской модели?
Откуда модель берёт сами навыки?
Связано ли это с тем, как LLM-агенты разбивают задачи?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.