Законы масштабирования языковых моделей: что показали Каплан и Chinchilla
Почему GPT-3 недоучили, сколько токенов нужно на параметр и где предел кривой качества. Разбираем работы OpenAI и DeepMind, которые задали правила игры для всей индустрии.

В январе 2020 года команда Джареда Каплана из OpenAI опубликовала работу «Scaling Laws for Neural Language Models», которая на два года стала главным ориентиром для всех, кто тренировал большие языковые модели. Вывод статьи был простым до неприличия: качество модели предсказуемо падает по степенному закону, если увеличивать три параметра — число весов, объём датасета и вычислительный бюджет. Через два года DeepMind в работе про Chinchilla показала, что Каплан ошибся в пропорциях, и половина индустрии внезапно поняла, что тренировала модели неправильно.
Что именно открыл Каплан
Основной результат работы OpenAI: loss на тесте убывает как степенная функция от N (числа параметров), D (размера датасета в токенах) и C (compute во FLOPs). Формула для параметров выглядит так:
L(N) = (N_c / N)^α_N, где α_N ≈ 0.076, N_c ≈ 8.8 × 10^13По человечески: удвоение модели снижает loss примерно на 5%. И так — на семи порядках величины. Никаких плато, никаких резких переходов, гладкая прямая в логарифмических осях. Именно эта предсказуемость позволила OpenAI спокойно вкладывать сотни миллионов долларов в GPT-3: они знали заранее, какой loss получат.
Второй важный вывод касался того, куда тратить бюджет. Каплан утверждал, что при увеличении compute в 10 раз оптимально увеличить модель в 5.5 раза, а датасет — только в 1.8 раза. Отсюда взялась мода на гигантские модели с относительно скромными датасетами: GPT-3 на 175 млрд параметров тренировали на 300 млрд токенов.
Как DeepMind всё переиграл
В марте 2022 года вышла работа «Training Compute-Optimal Large Language Models». DeepMind обучил 400 моделей от 70 млн до 16 млрд параметров на датасетах от 5 до 500 млрд токенов и получил другую картину: модель и датасет должны расти в одинаковых пропорциях. На каждый параметр — примерно 20 токенов.
Чтобы доказать это на практике, DeepMind обучил Chinchilla на 70 млрд параметров с 1.4 трлн токенов и сравнил с Gopher на 280 млрд параметров и 300 млрд токенов. Chinchilla обошла модель в четыре раза больше по себя почти на всех бенчмарках при том же бюджете обучения.
Половина существующих моделей на момент выхода Chinchilla оказались недоучены. Не потому что их плохо тренировали, а потому что все читали одну и ту же статью 2020 года.
Сравнение двух рецептов
| Параметр | Kaplan et al. 2020 | Chinchilla 2022 |
|---|---|---|
| Токенов на параметр | около 1.7 | около 20 |
| Рост модели при ×10 compute | ×5.5 | ×3.2 |
| Рост датасета при ×10 compute | ×1.8 | ×3.2 |
| Пример модели | GPT-3 (175B / 300B ток.) | Chinchilla (70B / 1.4T ток.) |
| Стоимость инференса | высокая (модель большая) | ниже в разы |
Почему разошлись результаты
DeepMind указал на два методологических огреха у OpenAI: фиксированное расписание learning rate независимо от длительности тренировки и слишком узкий диапазон размеров моделей. При правильно подобранном cosine schedule картина меняется.
Что из этого следует для практики
- Модель на 7 млрд параметров имеет смысл тренировать хотя бы на 140 млрд токенов, лучше больше;
- Llama 2 (7B на 2 трлн токенов) и Llama 3 (8B на 15 трлн токенов) — это уже сильно за пределами Chinchilla-оптимума в сторону датасета, что оправдано экономикой инференса;
- Стоимость обучения GPT-4-класса модели по открытым оценкам — 60–100 млн долларов, и ошибка в пропорциях N/D означает потерю десятков миллионов;
- Для маленькой модели, которую будут крутить миллиарды раз в проде, выгоднее пересыпать её токенами сверх Chinchilla, потому что инференс окупит переплату за тренировку.
Пределы законов масштабирования
Обе работы описывают только loss на предсказании следующего токена — то есть насколько хорошо модель угадывает продолжение текста. Это не то же самое, что качество на конкретных задачах. Emergent-способности (способность решать задачи, которых не было в явном виде в тренировке) законы Каплана не предсказывают: они появляются скачком на определённых масштабах, и заранее сказать, при каком именно, никто не умеет.
Второй потолок — данные. При 20 токенах на параметр модель на триллион весов требует 20 трлн токенов качественного текста. Common Crawl после чистки даёт порядка 10–15 трлн токенов на английском, и запас исчерпаем. Дальше начинаются синтетические данные, мультимодальность и повторные проходы по корпусу, где обычные scaling laws уже не работают напрямую.
Что смотреть дальше
После Chinchilla вышло несколько работ, уточняющих картину для смешанных данных и повторных эпох. Отдельный сюжет — inference scaling: OpenAI o1 и подобные модели показывают, что качество растёт и с увеличением compute на инференс, а не только на обучение. Это уже другая кривая, и её карту сейчас рисуют заново.
FLOPs — floating point operations, число операций с плавающей точкой. Стандартная мера вычислительного бюджета при обучении. Loss — значение функции потерь, для языковых моделей это обычно кросс-энтропия на предсказании следующего токена.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Scaling Laws for Neural Language Models (Kaplan et al., 2020), Training Compute-Optimal Large Language Models (Hoffmann et al., 2022)
Частые вопросы
Сколько токенов нужно на один параметр по Chinchilla?
Почему GPT-3 считается недоученной?
Действуют ли законы масштабирования для мультимодальных моделей?
Можно ли обойти нехватку данных повторными эпохами?
Что такое emergent-способности и почему их не предсказывают scaling laws?
Применимы ли законы Каплана к дообучению и RLHF?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.