Агенты DeepSeek против Qwen: чей стек выгоднее для задач
Две китайские модельные линейки, DeepSeek и Qwen от Alibaba, борются за одну нишу: дешёвые агенты, которые сами вызывают инструменты и пишут код. Разбираем, где чей стек сильнее и во что обходится.

Осенью 2024 года DeepSeek выпустила серию V3, а команда Qwen (Alibaba Cloud) — линейку Qwen2.5, включая специализированные Qwen2.5-Coder. Обе линейки открытые, обе бьют по одной точке: агенты, которые не просто болтают, а вызывают функции, ходят в API и правят код в цикле. Для разработчика, который строит автономного помощника, вопрос стоит ребром — на каком стеке дешевле и стабильнее. Ниже — не рейтинг «кто лучше», а разбор, где чей подход выигрывает и чем за это платишь.
Что вообще значит «агент» на этих моделях
Под агентом здесь понимается связка: языковая модель плюс механизм function calling*, который позволяет ей вызывать внешние инструменты — поиск, интерпретатор кода, базу данных — и получать результат обратно в контекст. Агент отличается от чата тем, что действует в несколько шагов: планирует, вызывает инструмент, читает ответ, корректирует план.
И DeepSeek, и Qwen поддерживают вызов функций в формате, близком к OpenAI-совместимому API. Это ключевой момент: код, написанный под OpenAI SDK, часто переносится на обе модели сменой базового URL и ключа. Но дьявол — в деталях: как модель форматирует аргументы, насколько дисциплинированно завершает многошаговую цепочку и не срывается ли в галлюцинацию вызова несуществующего инструмента.
DeepSeek: ставка на рассуждение и код
DeepSeek сделала себе имя на моделях, заточенных под логику и программирование. Линейка reasoning-моделей (серия R1) отдельно оптимизирована под пошаговое рассуждение: модель тратит «внутренние» токены на цепочку размышлений перед ответом. Для агента это плюс там, где нужно спланировать многоходовку — например, разбить задачу «собери данные, посчитай, построй отчёт» на подзадачи.
Обратная сторона — reasoning-режим генерирует много токенов «на подумать», и вы платите за них. Если задача простая (дёрнуть один API и вернуть ответ), рассуждающая модель может оказаться дороже и медленнее, чем нужно.
Qwen: широта линейки и мультимодальность
Qwen берёт другим — шириной. Линейка Qwen2.5 включает модели разных размеров, отдельную Qwen2.5-Coder под код и мультимодальные версии (Qwen-VL), которые понимают изображения. Для агента, которому нужно, скажем, читать скриншоты интерфейса или разбирать документы с картинками, это преимущество из коробки — DeepSeek исторически сильнее в тексте и коде, а не в зрении.
Alibaba также активно двигает инфраструктуру вокруг агентов — фреймворки и готовые шаблоны для оркестрации. Это снижает порог входа, если вы не хотите собирать пайплайн с нуля.
Выбор между DeepSeek и Qwen — это не «какая модель умнее», а «какая форма задачи у вас чаще». Reasoning-цепочки или мультимодальность, компактность или ширина линейки. Ответ зависит от вашего трафика, а не от лидерборда.
Сравнение по ключевым осям
Ниже — сопоставление по параметрам, которые реально влияют на агентский пайплайн. Точные цены на облачный инференс и лимиты меняются часто — сверяйте их на актуальных страницах провайдеров, а не по этой таблице.
| Ось | DeepSeek | Qwen (Alibaba) |
|---|---|---|
| Сильная сторона | Рассуждение, код, математика | Ширина линейки, мультимодальность |
| Мультимодальность | Ограниченная, фокус на тексте/коде | Есть (Qwen-VL) для изображений |
| Reasoning-режим | Отдельная линейка с цепочками рассуждений | Стандартный инференс, отдельные reasoning-версии тоже развиваются |
| Function calling | OpenAI-совместимый формат | OpenAI-совместимый формат |
| Открытые веса | Да, часть моделей | Да, часть моделей |
| Размеры моделей | Крупные MoE-модели | От компактных до крупных |
Function calling на практике
Главная боль агентов на любой модели — надёжность вызова инструментов. Проблемы, с которыми вы столкнётесь на обеих линейках:
- Невалидный JSON в аргументах. Модель может вернуть аргументы функции с лишней запятой или незакрытой кавычкой. Нужен слой валидации и повторного запроса.
- Галлюцинация инструмента. Модель вызывает функцию, которой нет в схеме. Решается строгой проверкой имени против списка перед исполнением.
- Срыв многошаговой цепочки. После третьего-четвёртого вызова модель может «забыть» исходную цель. Reasoning-модели DeepSeek держат цель дольше, но и стоят дороже.
- Зацикливание. Агент повторяет один и тот же вызов. Лечится жёстким лимитом шагов и детектором повторов.
Как выбрать под свою задачу
Не берите модель по лидерборду. Идите от формы вашей нагрузки:
- Опишите типовой сценарий агента. Сколько шагов, какие инструменты, нужны ли картинки. Один вызов API — это не то же самое, что цепочка из десяти.
- Оцените долю reasoning-задач. Если больше половины запросов требуют планирования и логики — смотрите в сторону рассуждающих моделей DeepSeek. Если это в основном простые вызовы — компактная Qwen дешевле.
- Проверьте, нужна ли мультимодальность. Скриншоты, сканы, фото — сразу склоняет к Qwen-VL.
- Прогоните свой набор тестов. Соберите 30–50 реальных запросов из вашего домена и прогоните на обеих моделях с одинаковой схемой инструментов. Считайте не «качество вообще», а процент успешно завершённых цепочек и стоимость на цепочку.
- Заложите смену провайдера. Раз обе линейки OpenAI-совместимы, держите базовый URL и имя модели в конфиге. Тогда переезд с одной на другую — вопрос двух строк, а не переписывания пайплайна.
Цена вопроса
Разница в стоимости прячется не в цене за токен, а в архитектуре агента. Reasoning-модель генерирует токены рассуждений — на длинной цепочке из десяти вызовов это может утроить счёт по сравнению с обычной моделью, которая просто дёргает инструменты. Компактная Qwen на простых задачах отработает дешевле, но на сложном планировании её придётся «подпирать» дополнительными шагами и промптами, что съест экономию. Единственный честный ответ даёт замер на вашем трафике.
* Function calling — механизм, при котором модель возвращает не текст, а структурированный вызов функции с аргументами. Внешний код исполняет функцию и отдаёт результат модели обратно. Это основа агентов: без него модель может только советовать, но не действовать.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: DeepSeek — официальная документация API, Qwen — официальная документация (Alibaba Cloud)
Частые вопросы
Можно ли перенести код с OpenAI SDK на DeepSeek или Qwen без переписывания?
Какая модель лучше держит длинную цепочку вызовов инструментов?
Что выбрать, если агенту нужно работать с изображениями?
Насколько надёжен вызов функций на этих моделях?
Актуальны ли цены и лимиты, указанные в статье?
Как честно сравнить две модели под свою задачу?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.