Модели, которые учатся угадывать чужие намерения
Способность предсказывать намерения другого агента — старая задача из психологии, которую теперь решают внутри нейросетей. Разбираем, что такое машинная «теория разума» и где она уже ломается.

Осенью 2023 года несколько групп исследователей независимо друг от друга показали одно и то же: крупные языковые модели решают классические тесты на «теорию разума» — те самые задачи с ложными убеждениями, которые психологи дают четырёхлетним детям. Модель уверенно отвечает, где Салли будет искать шарик, хотя Энн его переложила. А затем ту же задачу переписывают другими словами, меняют имена и порядок предложений — и точность падает. Спор о том, что это значит, не утих до сих пор: научилась ли машина рассуждать о чужих мыслях или запомнила форму задачи.
Что называют «моделью чужого разума»
Теория разума1 — способность приписывать другому агенту убеждения, желания и намерения, отличные от твоих собственных. У человека она разворачивается годами: ребёнок сначала не отделяет своё знание от чужого, потом учится понимать, что другой может ошибаться, обманывать, знать меньше или больше него.
В машинном обучении задача формулируется прикладнее. Агенту нужно предсказать поведение другого агента — не потому что это философски интересно, а потому что без этого он не сможет договориться, помочь или не помешать. Робот на складе, который не моделирует траекторию человека, наедет на него. Диалоговый ассистент, который не отслеживает, что пользователь уже знает, будет либо занудно повторять очевидное, либо перепрыгивать через объяснения.
Два разных подхода
Исторически сложились две линии. Первая — явное моделирование: агент строит внутреннее представление другого агента, его целей и наблюдений, и прогоняет через него гипотезы. Классический пример из мультиагентного обучения — Machine Theory of Mind, работа DeepMind 2018 года, где отдельная сеть-«наблюдатель» училась предсказывать действия других агентов, наблюдая за их прошлым поведением.
Вторая линия появилась позже и почти случайно: оказалось, что языковые модели, обученные просто предсказывать следующее слово на огромных текстах, начинают проходить тесты на ложные убеждения без всякой специальной архитектуры. Никто не закладывал в них «модуль теории разума» — способность возникла как побочный продукт.
Почему тесты — ненадёжный термометр
Главная проблема оценки в том, что задачи на теорию разума хорошо известны и много раз описаны в интернете. Если модель видела тысячи вариантов «задачи Салли и Энн» в обучающих данных, её правильный ответ не доказывает понимания — он может быть узнаванием шаблона.
Исследователи проверяют это возмущениями: меняют имена, добавляют нерелевантные детали, переворачивают логику вопроса. Результаты противоречивы. В одних работах модели держат удар и обобщают на новые формулировки, в других — рассыпаются от минимальных изменений, которые ребёнок бы проигнорировал.
Пройти тест на ложное убеждение и понимать, что другой человек ошибается, — это может быть одно и то же, а может быть двумя совершенно разными вещами. Пока у нас нет способа надёжно их различить, любые громкие заявления стоит читать с поправкой на метод оценки.
Отсюда осторожность в формулировках. Корректнее говорить не «модель обладает теорией разума», а «модель демонстрирует поведение, неотличимое от теории разума на данном наборе задач». Разница не занудная: от неё зависит, доверите ли вы системе решения, где цена ошибки — реальный вред.
Где это уже применяют
Моделирование чужих намерений — не только академический сюжет. Оно встроено в несколько практических направлений.
- Кооперативные агенты. В играх и симуляциях агенту выгодно предсказывать, что сделает напарник, чтобы не дублировать усилия и не мешать. Здесь модель другого — часть стратегии.
- Робототехника и совместная работа с человеком. Предсказание траектории и намерения человека рядом — вопрос безопасности, а не удобства.
- Диалоговые ассистенты. Отслеживание того, что пользователь уже знает и чего хочет на самом деле, отличает полезный ответ от формально правильного, но бесполезного.
- Обучающие системы. Модель ученика — представление о том, что он понял, а что нет — позволяет адаптировать объяснение.
Сравнение подходов
| Признак | Явное моделирование | Эмерджентное (в LLM) |
|---|---|---|
| Как возникает | Спроектировано архитектурой | Побочный продукт обучения |
| Интерпретируемость | Выше: можно посмотреть на прогноз | Ниже: чёрный ящик |
| Обобщение на новое | Ограничено дизайном | Шире, но нестабильно |
| Где применяют | Мультиагентные среды, робототехника | Языковые ассистенты, диалог |
Что мешает довериться этому в реальных задачах
Три вещи. Первая — хрупкость: система, уверенно проходящая бенчмарк, может ошибиться на слегка нестандартной ситуации, а именно нестандартные ситуации опаснее всего. Вторая — оценочная слепота: мы не умеем надёжно отделить понимание от запоминания, значит, не можем гарантировать поведение вне тестового распределения. Третья — асимметрия цены: в чате ошибка модели о намерениях пользователя стоит недопонимания, а в физической системе рядом с человеком — травмы.
Практический вывод для тех, кто строит продукты: не полагайтесь на «модель понимает пользователя» как на данность. Проверяйте её на своих, а не на хрестоматийных сценариях, и закладывайте запас на ошибку там, где её цена высока.
1 Теория разума (theory of mind) — термин из когнитивной психологии: способность приписывать себе и другим ментальные состояния (убеждения, намерения, знания) и понимать, что они могут отличаться от реальности и друг от друга.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Machine Theory of Mind (Rabinowitz et al., DeepMind), Theory of Mind Might Have Spontaneously Emerged in Large Language Models (Kosinski)
Частые вопросы
Значит ли прохождение тестов, что модель действительно «понимает» людей?
Чем машинная теория разума отличается от обычного предсказания поведения?
Почему одни исследования показывают успех, а другие — провал?
Можно ли доверять таким системам в робототехнике рядом с людьми?
Нужна ли отдельная архитектура, чтобы модель училась моделировать чужие намерения?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.