Как измерить прогресс к AGI: спор о когнитивной рамке
Единого способа замерить приближение к AGI нет. Разбираем, чем бенчмарки вроде ARC-AGI отличаются от узких тестов и почему исследователи спорят о самом определении цели.

В декабре 2024 года модель OpenAI o3 набрала 87,5% на закрытой части бенчмарка ARC-AGI-1 — тесте, который человек проходит в среднем на уровне около 80%, а предыдущие модели не могли перешагнуть и 30%. Автор теста Франсуа Шолле, до этого несколько лет утверждавший, что языковые модели упираются в потолок, признал результат прорывом. Но тут же добавил: это не значит, что достигнут AGI. И в этом добавлении — вся суть проблемы. Мы научились строить модели, обгоняющие человека на отдельных задачах, но так и не договорились, как измерять движение к общему интеллекту.
Цена вопроса не абстрактная. От того, каким тестом мерить прогресс, зависят инвестиционные раунды на десятки миллиардов долларов, приоритеты исследовательских лабораторий и аргументы регуляторов. Если считать AGI набором высоких баллов на экзаменах, он «почти достигнут». Если — способностью учиться новому так же экономно, как человек, дистанция остаётся огромной.
Почему обычные бенчмарки перестали работать
Классический способ оценить модель — прогнать её через набор задач: MMLU (вопросы по 57 предметам), GSM8K (школьная математика), HumanEval (генерация кода). Проблема в том, что как только бенчмарк становится популярным, начинается гонка за баллами, а не за способностями.
Есть две системные ловушки:
- Загрязнение данных. Тестовые задачи и ответы к ним попадают в обучающий корпус модели. Формально она «решает» задачу, фактически — вспоминает виденное. Отделить понимание от запоминания на закрытых тестах почти невозможно.
- Насыщение. Когда топовые модели набирают 90+% на MMLU, тест перестаёт различать их между собой. Разница в один-два процента тонет в шуме от неоднозначных формулировок вопросов.
Отсюда — новое поколение тестов, которые целятся не в объём знаний, а в способность рассуждать над незнакомым. «Humanity's Last Exam» собирает вопросы экспертного уровня, на которые нет готовых ответов в интернете. ARC-AGI строится на визуальных головоломках, где каждую задачу нужно решать с нуля по нескольким примерам.
Что предлагает когнитивная рамка
Идея когнитивного подхода: не спрашивать «сколько задач модель решила», а раскладывать интеллект на составляющие способности и мерить каждую отдельно. Это ближе к тому, как психология описывает человеческий интеллект — через набор когнитивных функций, а не одну цифру.
Условно можно выделить несколько осей, по которым имеет смысл оценивать систему:
- Обобщение — перенос навыка на задачи, не встречавшиеся при обучении.
- Эффективность обучения — сколько примеров нужно, чтобы освоить новое. Человек часто схватывает правило с двух-трёх демонстраций.
- Композиционность — умение собирать сложное решение из простых, уже освоенных операций.
- Работа с памятью — удержание контекста и обращение к нему на длинной дистанции.
- Планирование — построение цепочки действий к цели, а не реакция на одиночный запрос.
- Метапознание — способность оценить собственную неуверенность и сказать «я не знаю».
Интеллект — это не навык. Навык — то, что вы умеете. Интеллект — то, насколько эффективно вы осваиваете новое, чего раньше не умели. Высокий балл на экзамене говорит о первом, а не о втором.
Skill против efficiency
Ключевое различие, вокруг которого строится ARC-AGI, — между демонстрацией навыка и эффективностью его приобретения. Модель может решить сложную задачу, потому что видела миллион похожих. Человек решает похожую задачу, увидев её впервые. Шолле формализует это через понятие skill-acquisition efficiency1: сколько новой компетенции система выжимает из ограниченного опыта и вычислений.
Именно поэтому результат o3 вызвал двойственную реакцию. Модель показала настоящее обобщение — но ценой вычислений, которые на высоком режиме, по оценкам, стоили тысячи долларов на одну задачу. Человек делает то же за минуты и центы электричества. По оси «навык» — паритет. По оси «эффективность» — пропасть.
Сравнение подходов к измерению
| Подход | Что мерит | Слабое место |
|---|---|---|
| Знаниевые бенчмарки (MMLU, GSM8K) | Объём и точность накопленных знаний | Загрязнение данных, быстрое насыщение |
| Экзамены экспертного уровня (HLE) | Глубину рассуждений на сложных вопросах | Всё ещё проверяет знание, а не адаптацию |
| Абстрактные головоломки (ARC-AGI) | Обобщение и эффективность обучения | Узкий домен, дорого масштабировать оценку |
| Агентные тесты (веб-задачи, среды) | Планирование и действия в среде | Трудно воспроизвести, результаты нестабильны |
| Когнитивная рамка (набор осей) | Профиль способностей целиком | Нет общепринятой методики и весов осей |
Ни одна строка не закрывает вопрос сама по себе. Именно поэтому серьёзные лаборатории публикуют не одну цифру, а таблицу из десятка тестов — и всё равно оставляют место для оговорок.
Где рамка ломается
Когнитивный подход красив на бумаге, но у него есть тяжёлые проблемы, о которых честно говорят сами исследователи.
Во-первых, антропоморфизм. Оси вроде «планирование» и «метапознание» взяты из психологии человека. Нет гарантии, что искусственная система вообще устроена по этим категориям — возможно, она решает задачи способом, для которого у нас нет слов и тестов.
Во-вторых, проблема весов. Даже если разложить интеллект на шесть осей, как их складывать в общую оценку? Что важнее — эффективность обучения или планирование? Единой методики нет, и любой выбор весов — это уже теоретическая позиция, а не измерение.
В-третьих, цель размыта. У AGI нет согласованного определения. OpenAI в уставе описывает его как «высокоавтономные системы, превосходящие человека в большинстве экономически ценных работ» — то есть через экономику, а не когнитивные функции. При таком определении важнее не абстрактное обобщение, а способность закрывать реальные рабочие задачи.
Что с этим делать читателю
Если вы следите за релизами моделей или принимаете решения на их основе, держите в голове несколько фильтров:
- Смотрите, на каком наборе тестов заявлен результат, а не на одну броскую цифру из пресс-релиза.
- Спрашивайте про стоимость вывода: балл, полученный за тысячи долларов вычислений на задачу, и балл в рамках дешёвого запроса — это разные новости.
- Проверяйте, закрытый ли тест. Результаты на публичных бенчмарках, чьи ответы могли попасть в обучение, стоят меньше.
- Разделяйте навык и адаптацию. «Решила экзамен» и «научилась новому с нуля» — не одно и то же.
Прогресс за последние два года реален и быстр — это видно и по ARC-AGI, и по агентным средам. Но «приблизились к AGI» и «набрали высокий балл» пока остаются двумя разными утверждениями. Пока рамка измерения не устоялась, любую цифру о близости AGI стоит читать вместе с вопросом: а что именно ею померили.
1 Skill-acquisition efficiency — эффективность приобретения навыка: мера того, сколько новой компетенции система получает на единицу опыта и вычислительных ресурсов. Противопоставляется простой демонстрации уже освоенного навыка.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: ARC Prize — On OpenAI o3 and the ARC-AGI benchmark, OpenAI Charter
Частые вопросы
Существует ли одна метрика, по которой можно измерить AGI?
Что показал результат o3 на ARC-AGI?
Чем когнитивная рамка лучше обычных бенчмарков?
Что такое загрязнение данных в бенчмарках?
Есть ли официальное определение AGI?
Значит ли высокий балл модели, что она близка к AGI?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.