Нейрон настроения: как сеть сама нашла тональность текста
OpenAI в 2017 году обучала модель просто предсказывать следующий символ в отзывах Amazon — а внутри неё сам собой возник один нейрон, отвечающий за позитив и негатив.

В 2017 году исследователи OpenAI обучали рекуррентную нейросеть на массиве отзывов покупателей Amazon. Задача была скучная и техническая: предсказывать следующий символ в тексте, букву за буквой. Никто не размечал отзывы как хорошие или плохие, никто не объяснял модели, что такое настроение. А когда обученную сеть вскрыли, обнаружили, что внутри LSTM-слоя из 4096 нейронов один-единственный отвечает за тональность текста. Его так и назвали — sentiment neuron, нейрон настроения.
Это был ранний и наглядный пример того, что позже стало общим местом больших языковых моделей: обучаясь на простой задаче предсказания, сеть выучивает высокоуровневые понятия, которых никто ей специально не давал.
Что именно сделали в OpenAI
Работа называлась Learning to Generate Reviews and Discovering Sentiment, авторы — Алек Рэдфорд, Растислав Йожефович и Илья Суцкевер. Архитектура — многослойная LSTM* с 4096 скрытых юнитов, обученная как посимвольная языковая модель. Датасет — примерно 82 миллиона отзывов Amazon.
Ключевая цель формулировалась узко: научить модель по началу текста угадывать следующий символ. Никакой информации о том, хвалит покупатель товар или ругает, в обучении не участвовало. Это называется unsupervised learning — обучение без учителя, без размеченных ответов.
Дальше исследователи взяли внутренние активации сети и попробовали использовать их как признаки для классификатора тональности. И тут выяснилось интересное: подавляющая часть точности держалась на одном нейроне. Если построить его значение вдоль текста, оно ползёт вверх на позитивных формулировках и вниз на негативных.
Модель, которую никто не просил понимать эмоции, выделила отдельную ось для эмоций — потому что без неё было труднее угадывать, каким словом продолжится отзыв.
Почему это удивило
До этого распознавание тональности решали в лоб: собирали размеченный корпус, где каждый отзыв помечен как позитивный или негативный, и обучали классификатор. Размётка стоит денег и времени. А здесь модель добралась до понятия тональности бесплатно, как побочный эффект другой задачи.
На бенчмарке Stanford Sentiment Treebank в бинарном режиме признаки этой модели давали результат на уровне сильных методов того времени. Причём отдельно подчёркивался эффект малых данных: линейный классификатор поверх активаций достигал высокой точности, обучившись всего на нескольких десятках размеченных примеров. Там, где обычному методу нужны были тысячи, здесь хватало горстки.
Логика простая, если подумать
Чтобы хорошо предсказывать текст отзыва, полезно понимать его эмоциональную окраску. После слов "этот товар полное" вероятнее продолжение "разочарование", чем "восхищение", если весь предыдущий контекст был негативным. Тональность — это сжатое представление, которое реально помогает угадывать символы. Поэтому сеть и выделила под неё ресурс.
Что это значит для сегодняшних моделей
Сейчас идея звучит почти банально, но именно на таких экспериментах строилась логика перехода к большим предобученным моделям. Общая цепочка рассуждений оказалась такой:
- простая задача предсказания следующего токена заставляет модель строить внутренние представления мира;
- эти представления содержат осмысленные абстрактные понятия, а не только статистику символов;
- значит, можно сначала обучить большую модель без разметки на огромном корпусе, а потом дообучать под конкретные задачи малой кровью.
Это ровно та схема pretraining плюс fine-tuning, на которой позже выросли GPT, BERT и всё, что за ними последовало. Нейрон настроения был одним из ранних доказательств, что подход рабочий.
И для интерпретируемости тоже
Отдельная ценность истории — в том, что понятие оказалось локализовано в одном нейроне. Обычно абстракции в нейросетях размазаны по множеству активаций, и вытащить оттуда конкретный смысл трудно. Здесь же нашёлся чистый случай, когда один юнит соответствует одному человекочитаемому свойству. Это направление — поиск интерпретируемых признаков внутри моделей — сейчас активно развивается, например через разреженные автоэнкодеры, которые пытаются разложить активации на понятные компоненты.
Границы истории
Не стоит делать из одного нейрона универсальный вывод. Несколько оговорок:
| Что казалось | Как на самом деле |
|---|---|
| Модель "поняла" эмоции | Она выучила статистический сигнал, полезный для предсказания символов в отзывах |
| Так работает любая сеть | Эффект показан на конкретной архитектуре и конкретном домене — отзывах товаров |
| Один нейрон = одно понятие всегда | Это редкий чистый случай; чаще признаки распределены |
Домен отзывов сам по себе пропитан оценочностью — покупатели постоянно что-то хвалят или ругают. На тексте другого сорта такой выраженной оси настроения могло и не возникнуть.
* LSTM (long short-term memory) — тип рекуррентной нейросети, способный удерживать информацию о предыдущих элементах последовательности на длинных отрезках. До распространения трансформеров LSTM были основным инструментом для работы с текстом и другими последовательностями.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: OpenAI — Unsupervised sentiment neuron, Radford, Jozefowicz, Sutskever — Learning to Generate Reviews and Discovering Sentiment (arXiv)
Частые вопросы
Кто и когда обнаружил нейрон настроения?
Модель специально учили распознавать тональность?
Почему тональность оказалась именно в одном нейроне?
Как это связано с современными LLM вроде GPT?
Можно ли повторить такой результат на любых текстах?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.