RAG или fine-tuning: как выбрать основу для AI-агента
Два подхода наделяют агента знаниями: подключить внешнюю базу через RAG или дообучить модель. Разбираем, что дешевле, что точнее и когда одно не заменяет другое.

Когда агенту нужно знать то, чего нет в базовой модели — внутренние регламенты компании, каталог из 40 000 товаров, свежую судебную практику — разработчик стоит перед развилкой. Первый путь: подключить к агенту поиск по документам и подсовывать ему нужные куски прямо в запрос — это RAG. Второй: дообучить саму модель на своих данных — fine-tuning. Выбор влияет на стоимость запуска, скорость ответа и на то, как часто вы будете возвращаться к системе с обновлениями.
Что делает каждый подход
RAG (retrieval-augmented generation) не меняет модель. Перед тем как отправить вопрос пользователя в LLM, система ищет релевантные фрагменты в вашей базе — обычно через векторный поиск¹ — и вклеивает их в промпт. Модель отвечает, опираясь на этот контекст. Знания живут снаружи, в базе, и модель к ним обращается на лету.
Fine-tuning меняет веса модели. Вы берёте базовую LLM и дообучаете её на своём датасете — парах «вопрос-ответ», примерах нужного стиля или формата. Знания и поведение зашиваются внутрь. После обучения модель отвечает нужным образом без дополнительного контекста в промпте.
RAG отвечает на вопрос «что модель знает». Fine-tuning отвечает на вопрос «как модель себя ведёт». Это разные оси, и путать их — главная ошибка при проектировании агента.
Где проходит граница
Практическое правило: если проблема в фактах, которых у модели нет или которые часто меняются — это территория RAG. Если проблема в поведении, тоне, формате или узкой доменной терминологии — ближе fine-tuning.
Агенту поддержки, который должен отвечать по актуальной документации продукта, обновляемой каждую неделю, fine-tuning противопоказан: переобучать модель на каждое изменение дорого и медленно. Подключаете RAG к базе документации — и новая статья доступна агенту сразу после индексации.
Обратный случай: агент должен всегда возвращать ответ строго в формате JSON определённой схемы, говорить сдержанным юридическим тоном и понимать сокращения вашей отрасли. Это про поведение — и тут дообучение работает лучше, чем длинные инструкции в промпте.
Комбинация вместо выбора
На практике зрелые агенты часто используют оба подхода одновременно. Модель дообучают на формат и стиль ответов, а фактическую базу подключают через RAG. Так вопрос «или-или» превращается в вопрос «что чем закрываю».
Сравнение по ключевым параметрам
| Параметр | RAG | Fine-tuning |
|---|---|---|
| Обновление знаний | Переиндексировать базу — минуты | Переобучить модель — часы или дни |
| Стоимость старта | Ниже: не нужен датасет для обучения | Выше: сбор и разметка данных, обучающий прогон |
| Задержка ответа | Выше: поиск + больший промпт | Ниже: знания уже внутри |
| Источник в ответе | Можно показать, откуда взят факт | Нет: модель «просто знает» |
| Контроль над стилем | Слабый: через инструкции | Сильный: зашит в веса |
| Риск галлюцинаций | Ниже при точном поиске | Не снижает сам по себе |
Цифры по стоимости обучения сильно зависят от провайдера и объёма данных — актуальные цены на fine-tuning уточняйте в документации конкретной платформы (OpenAI, Anthropic, открытые модели через собственную инфраструктуру), они регулярно меняются.
Когда какой подход брать
Разложим по типовым задачам агента.
- База знаний меняется чаще раза в месяц — RAG. Дообучение не угонится за изменениями.
- Нужна ссылка на источник ответа — RAG. Требование частое в юридических, медицинских и финансовых сценариях, где ответ без основания бесполезен.
- Строгий формат вывода или узкий стиль — fine-tuning. Промпт-инструкции работают, но менее надёжно на длинной дистанции.
- Домен с редкой терминологией, которую базовая модель понимает плохо — fine-tuning помогает ей «выучить язык» предметной области.
- Ограниченный бюджет и сжатые сроки MVP — почти всегда RAG: быстрее собрать, дешевле проверить гипотезу.
- Высокая нагрузка и требование к скорости — fine-tuning выигрывает: короче промпт, меньше токенов, ниже задержка на запрос.
Скрытые издержки, о которых забывают
RAG кажется бесплатным на входе, но качество упирается в качество поиска. Плохо нарезанные документы, слабая модель эмбеддингов, отсутствие ре-ранкинга — и агент цитирует нерелевантные куски, звуча уверенно и ошибаясь. Инженерная работа по настройке пайплайна retrieval часто недооценивается.
Fine-tuning прячет издержки в данных. Нужен чистый, размеченный, репрезентативный датасет. Обучение на шумных примерах закрепит ошибки в весах, и вытащить их обратно уже не выйдет — только переобучение с нуля.
Как выбрать за пять шагов
- Определите, в чём проблема: в незнании фактов или в неправильном поведении. От этого зависит всё остальное.
- Оцените, как часто меняются данные. Ежедневно или еженедельно — сразу склоняйтесь к RAG.
- Проверьте, нужна ли трассируемость ответа до источника. Если да — RAG почти безальтернативен.
- Прикиньте бюджет и сроки. Для быстрой проверки гипотезы начинайте с RAG, дообучение отложите.
- Если после RAG остаётся проблема стиля или формата — добавьте fine-tuning поверх, не вместо.
¹ Векторный поиск — метод, при котором тексты переводятся в числовые векторы (эмбеддинги), а близость по смыслу вычисляется как близость векторов в пространстве. Позволяет находить фрагменты, похожие по смыслу на запрос, даже без совпадения слов.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: OpenAI — Fine-tuning guide, OpenAI — Retrieval and RAG concepts
Частые вопросы
Можно ли обойтись только промптом без RAG и fine-tuning?
Что дешевле на старте — RAG или fine-tuning?
Убирает ли fine-tuning галлюцинации?
Как обновлять знания агента после fine-tuning?
Можно ли совмещать оба подхода в одном агенте?
Что выбрать для агента поддержки по документации?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.