Почему обучение ИИ дорожает быстрее, чем растёт качество
Каждое удвоение размера модели требует непропорционально больше данных и вычислений. Разбираем законы масштабирования: сколько это стоит и где рост упирается в потолок.

Обучение GPT-3 в 2020 году оценивали примерно в несколько миллионов долларов за один прогон. Для моделей поколения 2023–2024 годов публичные оценки затрат на обучение выросли до десятков и даже сотен миллионов долларов — при том что качество ответов, которое чувствует обычный пользователь, растёт заметно медленнее, чем счета за вычисления. Это не бухгалтерская случайность, а прямое следствие того, как устроено масштабирование нейросетей.
Что такое законы масштабирования
Законы масштабирования (scaling laws) — эмпирические зависимости, которые связывают три величины: число параметров модели, объём обучающих данных и количество вычислений. Работа команды OpenAI 2020 года и последующее исследование Chinchilla от DeepMind показали, что ошибка модели падает не линейно, а по степенному закону. На практике это значит: чтобы срезать ошибку вдвое, ресурсов нужно вложить в несколько раз больше.
Степенной закон — это плохая новость для бюджета и хорошая для планирования: он предсказуем. Вы заранее знаете, что следующий шаг качества обойдётся дороже предыдущего, и можете считать деньги, а не надеяться на чудо.
Ключевая метрика здесь — вычислительный бюджет, который обычно измеряют в FLOP*. Приблизительно объём вычислений на обучение равен произведению числа параметров на число обработанных токенов, умноженному на константу порядка шести. Отсюда следует простая мысль: наращивать только размер модели бессмысленно, если данных не хватает.
Урок Chinchilla
До 2022 года индустрия соревновалась в числе параметров: чем больше, тем лучше. Исследование Chinchilla перевернуло логику. Оказалось, что многие крупные модели того времени были недообучены — им дали слишком мало данных на слишком большое тело. Вывод: при фиксированном вычислительном бюджете число параметров и число токенов данных стоит наращивать примерно синхронно, а не гнаться за одним размером.
Практический итог — модель поменьше, но накормленная бо́льшим объёмом данных, обгоняет раздутого гиганта при тех же затратах на обучение. Именно поэтому современные модели среднего размера часто работают лучше, чем модели-предшественники с большим числом параметров.
Три стены, в которые упирается масштабирование
Простое «добавим ещё вычислений» перестаёт работать по нескольким причинам одновременно.
- Данные. Качественного текста в открытом доступе конечное количество. Ряд исследователей (в том числе работа Epoch AI) прогнозируют, что запас высококачественных текстовых данных для обучения может быть в значительной мере исчерпан в течение ближайших лет. Точные сроки — предмет спора, но направление признаётся многими.
- Вычисления и энергия. Кластеры на десятки тысяч ускорителей упираются в поставки чипов, электроэнергию и охлаждение. Стоимость растёт не только за счёт железа, но и за счёт инфраструктуры вокруг него.
- Экономика отдачи. Степенной закон означает убывающую отдачу: каждый следующий процент качества стоит дороже предыдущего. В какой-то момент прирост перестаёт окупаться для конкретной задачи.
Куда сместился фокус
Когда наращивать обучение в лоб становится дорого, инженеры переключаются на другие рычаги:
- Качество данных вместо количества. Фильтрация, дедупликация, отбор доменов дают прирост дешевле, чем очередное удвоение объёма.
- Обучение с обратной связью. Дообучение под инструкции и на предпочтениях людей улучшает полезность модели без пропорционального роста базового обучения.
- Вычисления на этапе ответа (inference-time compute). Модели, которые «думают» дольше над сложной задачей, показывают, что часть прироста можно перенести с обучения на момент использования.
- Архитектурные приёмы. Разреженные модели вроде mixture-of-experts активируют только часть параметров на каждый запрос, снижая стоимость работы.
Сколько это стоит на разных этапах
Цифры ниже — порядковые ориентиры из публичных оценок, а не официальные бюджеты компаний. Точные суммы лаборатории почти никогда не раскрывают, а методики подсчёта различаются.
| Этап | Что растёт | Порядок затрат |
|---|---|---|
| Предобучение | Параметры, данные, вычисления | Основная и самая крупная статья расходов |
| Дообучение | Инструкции, обратная связь | Заметно дешевле предобучения |
| Инференс | Число запросов пользователей | Растёт с аудиторией, может превысить обучение суммарно |
Важный нюанс: для популярного продукта суммарная стоимость инференса — обслуживания живых запросов — со временем способна превысить одноразовые затраты на обучение. Поэтому оптимизация не заканчивается в момент выпуска модели.
Что это значит для тех, кто не строит модели сам
Если вы выбираете модель под задачу, законы масштабирования подсказывают трезвый подход. Более крупная модель не гарантированно лучше для вашей конкретной работы, а её вызовы стоят дороже. Часто модель среднего размера с хорошим дообучением закрывает задачу дешевле, чем флагман.
- Сравнивайте не размер, а результат на ваших собственных примерах.
- Считайте стоимость запроса, а не только цену подписки: у API она зависит от числа токенов.
- Для повторяющихся задач проверяйте, не хватит ли модели поменьше или дообучения под ваш домен.
* FLOP (floating point operations) — количество операций с плавающей точкой. В контексте обучения ИИ это мера объёма вычислений: чем больше FLOP затрачено на прогон, тем дороже и дольше обучение.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Training Compute-Optimal Large Language Models (Chinchilla), DeepMind, Scaling Laws for Neural Language Models, OpenAI
Частые вопросы
Правда ли, что чем больше параметров, тем умнее модель?
Закончатся ли данные для обучения ИИ?
Почему обучение дорожает быстрее, чем растёт качество?
Что дороже — обучить модель или её обслуживать?
Стоит ли всегда выбирать самую большую доступную модель?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.