Как агенты изобретают язык: механика эмерджентной речи
Когда нейросети учатся координироваться, они начинают придумывать собственные сигналы. Разбираем, как из простой игры в передачу сообщений рождается язык с признаками композиционности.

Посадите двух нейросетевых агентов в общую среду, дайте им канал для обмена дискретными символами и задачу, которую в одиночку не решить, — и через десятки тысяч эпизодов обучения они начнут обмениваться сообщениями, которые внешний наблюдатель может расшифровать. Не человеческим языком, а собственным протоколом: один символ закрепляется за цветом, другой за направлением, третий за объектом. Это направление исследований называют emergent communication, и оно выросло из статьи Игоря Мордача и Пиетера Аббеля Emergence of Grounded Compositional Language in Multi-Agent Populations (2017), которую до сих пор берут за отправную точку.
Интерес тут не академический. Если язык может возникать сам, из давления задачи, то в перспективе агенты в мультиагентных системах — от складской логистики до симуляций рынка — способны вырабатывать координацию без заранее прописанного протокола. Вопрос в том, насколько такой язык устойчив, переносим и понятен людям.
Что такое референциальная игра
Базовая постановка эксперимента почти всегда одна и та же — референциальная игра (referential game). Есть два агента: говорящий и слушающий.
- Говорящий видит целевой объект (картинку, набор признаков, позицию в пространстве) и отправляет сообщение — последовательность символов из ограниченного словаря.
- Слушающий получает сообщение и набор кандидатов, среди которых спрятан целевой объект, и должен выбрать правильный.
- Если выбор верный, оба получают вознаграждение. Если нет — ничего.
Ни у одного из агентов нет словаря на входе. Значения символов не заданы. Всё, что их связывает, — общий сигнал успеха. Через обучение с подкреплением агенты постепенно приходят к соглашению: какой символ что означает. Это и называется grounding — привязка символа к признаку реального объекта в среде, а не к другому символу.
Почему это сложнее, чем кажется
Проблема координации здесь острая. В самом начале сообщения говорящего для слушающего — шум. Слушающий не может научиться интерпретировать символы, пока говорящий не начал использовать их осмысленно, а говорящий не получает сигнала, пока слушающий не начал угадывать. Это классическая проблема курицы и яйца в мультиагентном обучении, и она объясняет, почему такие системы обучаются медленно и нестабильно.
Язык у агентов возникает не потому, что мы его закладываем, а потому что без общего кода они не могут решить задачу. Коммуникация — побочный продукт давления кооперации.
Композиционность: главный приз и главный спор
Самое интересное свойство, за которым охотятся исследователи, — композиционность. Человеческий язык композиционен: из ограниченного набора слов вы собираете бесконечное число новых смыслов, и «красный круг слева» понятен, даже если этой фразы вы раньше не слышали. Если у агентов возникает язык, где один символ отвечает за цвет, другой за форму, а их комбинация даёт составной смысл, — это признак композиционности.
Практическая выгода прямая: композиционный язык лучше обобщается. Агент, освоивший «красный» и «квадрат» по отдельности, справится с «красным квадратом», которого не видел при обучении. Это называют систематическим обобщением.
Но здесь начинается спор, который тянется по сей день. Многие возникающие протоколы только выглядят композиционными, а на деле оказываются набором произвольных кодов — так называемый холистический язык, где каждое сообщение целиком отображается на объект без внутренней структуры. Отличить одно от другого на глаз нельзя, для этого придумали метрики.
| Метрика | Что измеряет | Ограничение |
|---|---|---|
| Topographic similarity | Корреляцию между расстоянием в пространстве смыслов и расстоянием между сообщениями | Высокое значение не гарантирует человекочитаемости |
| Positional disentanglement | Насколько каждая позиция в сообщении отвечает за отдельный признак | Чувствительна к длине сообщений |
| Обобщение на held-out паре | Успех на комбинациях признаков, не встречавшихся при обучении | Требует аккуратного разбиения данных |
Вывод из накопленных работ отрезвляющий: композиционность возникает не сама по себе, а под давлением дополнительных условий. Ограниченный словарь, короткие сообщения, смена партнёров по коммуникации, необходимость передавать язык новым поколениям агентов — всё это подталкивает систему к структуре.
Что заставляет язык становиться структурным
Ключевую роль в исследованиях сыграла идея передачи культуры между поколениями — iterated learning1. Если периодически сбрасывать одного из агентов и заставлять нового учить язык у старого через ограниченный объём примеров, холистические коды не выживают: их слишком много, чтобы выучить с нескольких показов. Выживают компактные, обобщаемые правила. То есть композиционность становится следствием бутылочного горлышка обучения, а не наградой напрямую.
Факторы, которые на практике усиливают структурность языка:
- Давление на длину сообщений. Чем короче и дешевле сигнал, тем сильнее стимул переиспользовать символы.
- Популяция вместо пары. Когда агент общается с разными партнёрами, идиосинкразический код перестаёт работать — нужен общий, более регулярный.
- Смена поколений. Язык, который трудно выучить с нуля, вымывается.
- Разнообразие среды. Больше независимых признаков у объектов — сильнее выгода от их раздельного кодирования.
Где это уже пригождается
Emergent communication перестала быть чистой лабораторией. Похожие механики применяют для обучения координации в мультиагентном RL — например, когда агентам в общей задаче дают узкий канал связи и смотрят, выработают ли они полезный протокол вместо шума. Отдельное направление — использовать эти игры как тестовую площадку для гипотез о происхождении человеческого языка, где живые эксперименты невозможны.
Чего ждать не стоит
Важная оговорка для тех, кто читает заголовки про «ИИ придумал свой язык». Возникающие протоколы — это, как правило, десятки символов и жёсткая привязка к конкретной среде обучения. Это не тайное общение и не самозарождение сознания, а оптимизация под задачу координации. Знаменитый случай 2017 года, когда переговорные боты Facebook начали обмениваться странными на вид фразами, преподносили как «изобретение секретного языка» — на деле агенты просто дрейфовали от английского, потому что грамматичность их никто не штрафовал.
Второе ограничение — переносимость. Язык, выработанный одной популяцией под одну среду, обычно не понимает другая популяция. Универсального протокола, который бы возникал стабильно и одинаково, пока нет. И это, пожалуй, главная открытая проблема направления: воспроизводимость результатов между лабораториями остаётся слабым местом.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Mordatch, Abbeel. Emergence of Grounded Compositional Language in Multi-Agent Populations (arXiv:1703.04908), Lazaridou, Baroni. Emergent Multi-Agent Communication in the Deep Learning Era (arXiv:2006.02419)
Частые вопросы
Это тот самый случай, когда боты Facebook придумали язык и их пришлось отключать?
Можно ли расшифровать язык, который придумали агенты?
Почему композиционность вообще важна для практики?
Композиционный язык возникает у агентов сам собой?
Где эти исследования применяются за пределами лабораторий?
Значит ли это, что ИИ начинает мыслить как человек?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту. Instagram, Facebook и WhatsApp принадлежат компании Meta Platforms Inc., признанной в России экстремистской организацией; её деятельность на территории Российской Федерации запрещена.