Как измеряют ИИ-агентов: бенчмарки, метрики и их слепые зоны
Агент прошёл 70% задач в SWE-bench — и что это значит на практике? Разбираем, какие бенчмарки для агентов используют лабораторные команды, что они реально измеряют и где обманывают.

За последние два года «агент» стал главным словом в релизах ИИ-компаний: Anthropic, OpenAI и Google соревнуются в том, чей продукт сам напишет код, забронирует билет или проведёт исследование. Но за громкими цифрами вроде «решает 70% задач» скрывается вопрос, на который нет простого ответа: как вообще измерять систему, которая действует многошагово, обращается к инструментам и может пойти десятком разных путей к одной цели. Обычная метрика точности здесь ломается, и для оценки агентов выросла отдельная индустрия бенчмарков — со своими артефактами, накрутками и слепыми зонами.
Почему агента нельзя оценивать как обычную модель
Классическую языковую модель проверяют просто: дали вопрос, сравнили ответ с эталоном, посчитали долю правильных. С агентом1 так не выйдет по трём причинам.
- Многошаговость. Агент делает десятки действий подряд. Ошибка на шаге 3 отравляет всё, что дальше, а «правильность» финального результата не говорит, где именно всё пошло не так.
- Недетерминированность путей. К рабочему коду можно прийти разными способами. Эталонного «единственно верного» решения часто нет — есть только рабочий или нерабочий итог.
- Взаимодействие со средой. Агент дёргает API, читает файлы, запускает команды. Результат зависит от состояния этой среды, а не только от самой модели.
Поэтому агентов оценивают не по совпадению с эталонным текстом, а по исходу задачи: прошли тесты или нет, достигнута цель или нет, сколько это стоило по токенам и шагам.
Метрика агента — это не «насколько похож ответ на правильный», а «сработало ли то, что он сделал, в реальной среде». Разница как между экзаменом с вариантами ответов и стажировкой.
Ключевые бенчмарки и что они измеряют
Ни один бенчмарк не проверяет «агента вообще». Каждый заточен под класс задач, и цифры из разных тестов сравнивать напрямую нельзя.
SWE-bench — про инженерию
Самый цитируемый бенчмарк для кодовых агентов. Задачи взяты из реальных issue в GitHub-репозиториях Python-проектов: агенту дают описание бага или фичи и весь репозиторий, а он должен внести правку. Успех засчитывается, если проходят приложенные к задаче тесты. Есть облегчённый набор SWE-bench Verified — вручную отфильтрованная выборка, где задачи заведомо решаемы и корректно сформулированы. Именно проценты по Verified вы чаще всего видите в анонсах.
GAIA — про общие ассистентские задачи
Бенчмарк от команды исследователей (в том числе связанных с компанией Meta*) на вопросы, требующие рассуждения, работы с инструментами, чтения файлов и веба. Ответ — короткая точная строка, поэтому оценка автоматическая: совпало или нет. GAIA проверяет не код, а способность агента собрать ответ из нескольких источников и действий.
WebArena и подобные — про действия в браузере
Здесь агент управляет реалистичными веб-сайтами (магазин, форум, CMS), развёрнутыми локально, и должен выполнить задачу вроде «оформи возврат заказа». Оценивается достижение целевого состояния сайта. Такие бенчмарки жёстко наказывают агентов, которые «болтают», но не доводят действие до конца.
τ-bench — про диалог с инструментами и правилами
Проверяет агента в роли оператора поддержки: он общается с симулированным пользователем, вызывает функции (вернуть деньги, поменять бронь) и обязан соблюдать бизнес-правила. Интересен тем, что измеряет ещё и стабильность — прогоняет один сценарий несколько раз и смотрит, насколько устойчив результат.
| Бенчмарк | Что проверяет | Как считается успех | Слабое место |
|---|---|---|---|
| SWE-bench (Verified) | Правка кода в реальных репозиториях | Проходят ли тесты задачи | Только Python, риск утечки задач в обучение |
| GAIA | Мультишаговые вопросы с инструментами | Точное совпадение короткого ответа | Не проверяет действия, меняющие мир |
| WebArena | Действия в вебе | Достигнуто ли целевое состояние сайта | Сложно поддерживать, среды устаревают |
| τ-bench | Поддержка с вызовом функций и правилами | Итог + устойчивость по прогонам | Симулированный пользователь ≠ живой |
Метрики, которые важнее одной цифры «прошёл»
Процент решённых задач — только вершина. Команды, которые эксплуатируют агентов в проде, смотрят на несколько измерений сразу.
- Success rate (pass@1). Доля задач, решённых с первой попытки. Базовая метрика, но она скрывает нестабильность.
- Pass@k и pass^k. Pass@k — решена ли задача хотя бы в одной из k попыток (полезно, если есть кто проверит результат). Pass^k — решена ли во всех k подряд, то есть насколько агент надёжен. Для автономного агента вторая метрика честнее.
- Стоимость. Сколько токенов и шагов ушло на задачу. Агент, решающий на 5% больше задач за втрое большие деньги, в проде часто проигрывает.
- Latency. Сколько времени заняло. Для интерактивных сценариев критично.
- Промежуточные проверки. Оценка не только финала, но и отдельных шагов: правильный ли инструмент вызван, с правильными ли аргументами. Помогает понять, где именно ломается цепочка.
Где бенчмарки врут
Цифра в анонсе — это результат в конкретных условиях, а не обещание. Ловушек несколько.
- Загрязнение данных. Если задачи бенчмарка попали в обучающую выборку, модель «помнит» ответы. Для SWE-bench, собранного из публичного GitHub, это постоянный риск, и Verified лишь частично его снижает.
- Разные оснастки (scaffolding). Один и тот же LLM с разной обвязкой — набором инструментов, промптами, механизмом повторных попыток — даёт разброс в десятки процентов. Сравнивая «агент A против агента B», вы часто сравниваете оснастку, а не модель.
- Насыщение бенчмарка. Когда топовые системы упираются в потолок, бенчмарк перестаёт различать сильных. Это причина, по которой их регулярно усложняют и выпускают новые версии.
- Узость домена. 70% на Python-задачах не переносится на ваш стек, вашу CRM или ваши документы автоматически.
Кому это пригодится, а кому нет
Пригодится, если вы выбираете агента под задачу. Разработчик, оценивающий кодового помощника, должен смотреть на SWE-bench Verified именно на своём типе задач и обязательно на стоимость прогона, а не только на процент. Команда, строящая поддержку с автоматизацией возвратов, ближе к τ-bench: там важна устойчивость и соблюдение правил, а не эрудиция.
Пригодится, если вы строите собственную оценку. Публичные бенчмарки — образец методологии, но для продакшена почти всегда нужен свой набор задач на ваших данных. Иначе вы оптимизируете под чужой экзамен.
Не пригодится как аргумент «эта модель умнее». Разные бенчмарки, разные оснастки и разные версии делают лобовое сравнение цифр из двух пресс-релизов бессмысленным. Если рядом с числом нет названия теста, версии набора и описания оснастки — это маркетинг, а не измерение.
Не пригодится, если у вас редкий домен без публичных аналогов. Медицинский, юридический или узкопромышленный агент придётся оценивать вручную и на реальных кейсах — готового бенчмарка под вас, скорее всего, нет.
* Meta признана в России экстремистской организацией, её деятельность запрещена.
1 Агент — здесь: система на базе языковой модели, которая не просто выдаёт текст, а планирует и выполняет последовательность действий, вызывая внешние инструменты (код, поиск, API) и реагируя на их результат, чтобы достичь заданной цели.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: SWE-bench: Can Language Models Resolve Real-World GitHub Issues?, GAIA: a benchmark for General AI Assistants
Частые вопросы
Какой бенчмарк для агентов считается главным?
Почему один и тот же агент показывает разные результаты у разных исследователей?
Что означает pass@k и чем он отличается от pass^k?
Можно ли доверять проценту из пресс-релиза компании?
Нужен ли свой бенчмарк, если есть публичные?
Что такое загрязнение данных в контексте бенчмарков?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.