Как обучение без учителя изменило языковые модели
Предобучение на неразмеченном тексте вытеснило подход, где каждую задачу тренировали отдельно на размеченных данных. Разбираем, почему это сработало и что это меняет на практике.

До 2018 года стандартный рецепт для задач обработки языка выглядел так: берёшь размеченный датасет под конкретную задачу — классификацию тональности, ответы на вопросы, определение логической связи между фразами — и обучаешь на нём модель с нуля. Датасеты стоили дорого: разметка нескольких десятков тысяч примеров вручную занимала недели. Подход, при котором модель сначала читает гигабайты неразмеченного текста, а уже потом дообучается на маленькой размеченной выборке, перевернул эту экономику. На ряде бенчмарков одна и та же предобученная база обгоняла узкоспециализированные модели, натренированные под каждую задачу отдельно.
В чём была проблема размеченных данных
Текста в интернете практически бесконечно много, но почти весь он не размечен. Никто не подписал у каждого предложения его тональность, тему или логическую роль. Классическое обучение с учителем этот текст использовать не умело: ему нужны пары «вход — правильный ответ».
Отсюда два ограничения. Первое — потолок по объёму: модель видела только то, что успели разметить люди. Второе — узость: модель, обученная отличать положительные отзывы от отрицательных, ничего не знала о языке за пределами этой задачи. Каждую новую задачу приходилось начинать почти с нуля.
Главная идея предобучения проста: научить модель предсказывать текст по тексту — а размеченные данные подключить только на финальном, коротком этапе.
Что такое обучение без учителя в языке
Строго говоря, здесь речь чаще о самообучении*: разметку модель добывает из самого текста. Формулировки задачи бывают разными, но две стали опорными.
- Предсказание следующего слова. Модель получает начало фрагмента и учится угадывать, какое слово идёт дальше. Так устроены модели семейства GPT. Правильный ответ — это просто следующее слово в тексте, никакой ручной разметки не нужно.
- Восстановление пропущенных слов. В тексте случайным образом маскируют часть слов, и модель учится их восстанавливать по контексту слева и справа. Так устроен BERT. Этот приём называют masked language modeling.
В обоих случаях модель прогоняет через себя огромный корпус и постепенно выстраивает внутреннее представление о том, как устроен язык: какие слова сочетаются, какие конструкции типичны, как согласуются части предложения. Это представление и есть главный актив.
Предобучение и дообучение
Процесс делится на две фазы, и это важно понимать, чтобы не путать стоимость этапов.
- Предобучение (pretraining). Долгая и дорогая фаза на неразмеченном тексте. Требует много вычислений и времени. Делается один раз.
- Дообучение (fine-tuning). Короткая фаза, когда предобученную модель адаптируют под конкретную задачу на небольшом размеченном датасете. Дёшево и быстро относительно первой фазы.
Именно перенос знаний из первой фазы во вторую даёт эффект: базовые представления о языке уже есть, дообучению остаётся только «настроить» их под нужный формат ответа.
Два подхода: сравнение
| Параметр | Обучение с учителем под задачу | Предобучение + дообучение |
|---|---|---|
| Источник данных | Только размеченные примеры | Гигабайты неразмеченного текста плюс маленькая размеченная выборка |
| Стоимость разметки | Высокая на каждую задачу | Разметка нужна только на финальном этапе |
| Перенос на новые задачи | Каждая задача с нуля | Одна база под множество задач |
| Порог входа по вычислениям | Ниже | Предобучение требует серьёзных мощностей |
Почему это сработало
Предсказание следующего слова кажется примитивной задачей, но чтобы делать это хорошо на разнородном тексте, модели приходится улавливать многое: грамматику, факты о мире, логику рассуждения, стиль. Всё это косвенно закодировано в том, какое слово статистически уместно дальше. Масштабируя объём текста и размер модели, исследователи обнаружили, что качество на прикладных задачах растёт вместе с масштабом предобучения.
Отдельный сдвиг — few-shot и zero-shot режимы. Достаточно большая предобученная модель нередко решает новую задачу вообще без дообучения, если ей описать задачу текстом и дать пару примеров прямо в запросе. Это уже не про отдельную тренировку под каждую задачу, а про формулировку в промпте.
Где у подхода пределы
Обучение без учителя не устранило все проблемы, а сместило их.
- Качество данных. Модель впитывает то, что есть в корпусе, включая ошибки, предвзятость и токсичный текст.
- Стоимость предобучения. Порог для тренировки крупной базы с нуля вырос настолько, что немногие организации могут это позволить. Большинство берёт готовые модели.
- Правдивость. Модель, обученная на статистике текста, оптимизирует правдоподобие, а не истинность — отсюда уверенные, но неверные ответы.
Именно поэтому поверх предобучения появились дополнительные этапы — дообучение на инструкциях и обучение с обратной связью от человека, которые пытаются подровнять поведение модели под то, что от неё ждут пользователи.
* Самообучение (self-supervised learning) — вариант, где обучающий сигнал модель извлекает из самих данных, а не из ручной разметки. Термин «обучение без учителя» (unsupervised) используют шире, поэтому в контексте языковых моделей эти слова часто ставят рядом.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: OpenAI — Improving language understanding with unsupervised learning, BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding (arXiv)
Частые вопросы
Чем обучение без учителя отличается от обучения с учителем?
Зачем вообще нужно дообучение, если модель уже предобучена?
Можно ли обучить такую модель без больших вычислительных мощностей?
Почему модель уверенно выдаёт неверные факты?
Что такое few-shot и zero-shot?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.