Language Models are Few-Shot Learners: как GPT-3 поменяла правила
Статья OpenAI 2020 года про GPT-3 показала: языковой модели достаточно нескольких примеров в промпте, чтобы решать задачи без дообучения. Разбираем, что там внутри и почему это важно до сих пор.

В мае 2020 года OpenAI выложила препринт на 75 страниц с сухим названием Language Models are Few-Shot Learners. За этим текстом стояла модель на 175 миллиардов параметров — в десять раз больше предыдущего рекордсмена Turing-NLG от Microsoft. Но главное было не в размере. Авторы показали, что достаточно показать модели два-три примера прямо в запросе — и она начнёт решать задачу, которой её никто специально не учил. Из этой идеи вырос весь современный prompt engineering и рынок API-доступа к LLM.
Что именно сделали в статье
До GPT-3 стандартный цикл выглядел так: берёте предобученную модель вроде BERT, собираете размеченный датасет под свою задачу, дообучаете (fine-tuning), получаете специализированную модель. Для каждой задачи — отдельный чекпоинт и отдельные тысячи примеров.
OpenAI предложила смотреть иначе. Модель не трогаем вообще. Задачу описываем текстом внутри одного запроса и там же кладём несколько примеров решения. Модель продолжает текст — и вместе с продолжением выдаёт ответ.
Авторы разделили режимы работы:
- Zero-shot — только описание задачи, ноль примеров.
- One-shot — описание плюс один пример.
- Few-shot — описание плюс от нескольких до десятков примеров, сколько влезет в контекст.
Контекстное окно у GPT-3 было 2048 токенов — по нынешним меркам крошечное, но для перевода пар «английский — французский» этого хватало на десятки образцов.
Масштаб как отдельный ингредиент
В работе сравнили восемь моделей одной архитектуры разного размера — от 125 миллионов до 175 миллиардов параметров. Ключевой график статьи показывает: качество few-shot растёт с размером быстрее, чем zero-shot. То есть большая модель не просто лучше отвечает — она лучше учится на лету, из примеров в промпте.
| Модель | Параметров | Слоёв | Размер батча |
|---|---|---|---|
| GPT-3 Small | 125M | 12 | 0.5M |
| GPT-3 Medium | 350M | 24 | 0.5M |
| GPT-3 Large | 760M | 24 | 0.5M |
| GPT-3 XL | 1.3B | 24 | 1M |
| GPT-3 2.7B | 2.7B | 32 | 1M |
| GPT-3 6.7B | 6.7B | 32 | 2M |
| GPT-3 13B | 13B | 40 | 2M |
| GPT-3 175B | 175B | 96 | 3.2M |
Обучали на 300 миллиардах токенов из смеси Common Crawl, WebText2, книг и Википедии. По оценке самих авторов, тренировка GPT-3 175B заняла порядка нескольких тысяч петафлопс-дней. В деньгах — миллионы долларов только за вычисления, без учёта зарплат и подготовки данных.
Как выглядит few-shot на практике
Translate English to French:
sea otter => loutre de mer
peppermint => menthe poivrée
plush giraffe => girafe en peluche
cheese =>
Модель продолжает текст — и на месте пропуска появляется «fromage». Никакого дообучения, никакого специального декодера под перевод. Тот же приём работает для арифметики, ответов на вопросы, генерации кода и десятков других задач.
Что померили и где границы
Авторы прогнали модель через 42 бенчмарка. Результаты неровные:
- На LAMBADA (предсказание последнего слова в абзаце) few-shot GPT-3 выбила 86.4% — на тот момент state-of-the-art.
- На TriviaQA — 71.2% в few-shot, обошли fine-tuned SOTA без единого дообучения.
- На двухзначном сложении — 100% точности. На пятизначном — уже около 10%.
- На тестах на логический вывод (ANLI, RTE) GPT-3 отставала от специализированных моделей.
Отдельный раздел статьи авторы посвятили честному признанию: модель галлюцинирует, повторяется на длинных генерациях, воспроизводит гендерные и расовые стереотипы из обучающих данных, а на задачах на здравый смысл проваливается там, где человек не задумывается.
«Мы не находим убедительных доказательств того, что few-shot обучение действительно происходит во время инференса в человеческом смысле слова. Скорее, модель распознаёт паттерн задачи и подставляет наиболее вероятное продолжение».
Почему это оказалось важнее самой модели
GPT-3 задала три вещи, которые сегодня кажутся самоочевидными.
Первое. Одна модель — много задач. Раньше NLP-команда держала зоопарк из моделей под классификацию, извлечение сущностей, суммаризацию. После GPT-3 стандартом стал единый API, куда прилетают запросы разного типа.
Второе. Промпт стал новым интерфейсом программирования. Формулировка задачи, порядок примеров, разделители между ними — всё это влияет на качество сильнее, чем архитектурные тонкости. Из этого выросли chain-of-thought, ReAct, structured prompting и вся индустрия prompt engineering.
Третье. Экономика сместилась в сторону вывода. Дообучение перестало быть обязательным этапом — а значит, стоимость внедрения LLM для конкретной компании упала на порядки. Платите за токены API, а не за GPU-кластер под fine-tuning.
Что устарело за пять лет
Многие тезисы статьи теперь читаются иначе:
- Контекст 2048 токенов — смешно на фоне 200К у Claude и 1М у Gemini.
- Утверждение «модели такого размера дообучать непрактично» опровергнуто: LoRA и QLoRA позволяют донастраивать 70B-модели на одной видеокарте.
- Instruction tuning и RLHF, которых в статье не было, изменили поведение моделей радикально: ChatGPT — это не GPT-3, а её потомок с обучением на предпочтениях человека.
- Few-shot стал реже нужен: современные instruction-модели хорошо работают в zero-shot по чистому описанию задачи.
Что забрать с собой
Если вы сегодня строите продукт на LLM, идеи из статьи 2020 года всё ещё работают. Начинайте с zero-shot, не хватает качества — добавляйте примеры в промпт, не хватает и этого — думайте про RAG, и только в последнюю очередь про fine-tuning. Порядок примеров в few-shot до сих пор влияет на результат: перестановка последнего образца может двигать точность на несколько процентных пунктов. И помните главное наблюдение авторов: модель не «понимает» задачу, а распознаёт её паттерн. Значит, ваша работа — этот паттерн предъявить максимально чисто.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Brown et al. Language Models are Few-Shot Learners (arXiv:2005.14165), OpenAI blog: GPT-3 API announcement
Частые вопросы
Кто авторы статьи?
Чем GPT-3 отличалась от GPT-2 архитектурно?
Что такое in-context learning?
Почему few-shot иногда работает хуже zero-shot?
Можно ли повторить эксперимент сегодня?
Насколько актуальны выводы статьи в 2025 году?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.