Activation Atlases: как заглянуть внутрь зрения нейросети
OpenAI и Google Brain показали Activation Atlases — способ развернуть на плоскости то, что распознаёт свёрточная сеть внутри. Это не просто картинки: атлас вскрывает и слабые места классификаторов.

Что показали
В 2019 году исследователи из OpenAI и Google Brain опубликовали работу Activation Atlases — метод визуализации того, какие образы формируются внутри свёрточной нейросети при распознавании изображений. Эксперименты проводились на InceptionV1 (она же GoogLeNet) — классической сети, обученной на датасете ImageNet с тысячей категорий.
Идея простая на словах и сложная в реализации. Когда сеть смотрит на картинку, каждый её внутренний слой выдаёт набор чисел — активаций. По отдельности одна активация мало о чём говорит. Activation Atlases берёт активации с миллиона случайных фрагментов изображений, снижает их размерность и раскладывает похожие рядом на большой плоскости. Получается карта, по которой видно, какие визуальные понятия сеть научилась выделять и как они соседствуют друг с другом.
Чем это отличается от прежних методов
До атласов интерпретируемость строилась в основном двумя способами. Feature visualization показывала, на что реагирует отдельный нейрон — генерировала картинку, максимально его возбуждающую. Attribution-методы отвечали на вопрос «какие пиксели входа повлияли на ответ». Оба смотрят либо на один нейрон, либо на один вход.
Activation Atlases даёт общий вид. Не «что видит нейрон номер 476», а «какой словарь понятий есть у слоя целиком» — от текстур и узоров в ранних слоях до целых объектов и их частей в поздних.
Атлас — это не портрет одного нейрона, а карта коллективного зрения сети: видно не только отдельные детекторы, но и то, как понятия перетекают одно в другое.
Как устроен метод
Пайплайн строится в несколько шагов, и каждый из них можно повторить на своей модели:
- Прогнать через сеть большой набор изображений и собрать векторы активаций для случайных пространственных позиций — в оригинальной работе речь про порядка миллиона таких векторов.
- Снизить размерность этих векторов до двух измерений через UMAP*, чтобы похожие активации оказались рядом.
- Разбить плоскость на сетку ячеек и усреднить активации внутри каждой ячейки.
- Для усреднённой активации каждой ячейки сгенерировать картинку методом feature visualization — так ячейка получает наглядный образ.
На выходе — сетка иконок, где рядом лежат близкие по смыслу образы: мех животных перетекает в текстуры, детали морд собираются рядом с целыми мордами, а понятия вроде «вода» соседствуют с «пляжем» и «песком».
Атласы по классам
Отдельно интересны атласы, привязанные к конкретному классу. Метод показывает, какие внутренние образы сильнее всего толкают сеть к ответу «серый кит» или «акула». И тут вылезает неожиданное: детектор, помогающий классу «серый кит», реагирует в том числе на бейсбольные швы и красные полосы — потому что в обучающих картинах с китами часто мелькали характерные текстуры.
Атака на классификатор через атлас
Самая громкая часть работы — не красивые карты, а демонстрация уязвимости. Авторы показали атаку типа patch: если врезать в изображение маленький фрагмент с текстурой, которую атлас пометил как сильный признак другого класса, сеть меняет ответ.
Пример из статьи: к фотографии, которую сеть уверенно относит к одному классу, добавляют небольшой участок с образом «бейсбольного мяча» — и классификатор переключается на baseball, хотя для человека картинка не изменилась по смыслу. Атлас здесь работает как подсказка: он прямо указывает, какие текстуры дают наибольший сдвиг, не требуя перебора вслепую.
Это ценно не тем, что нейросеть можно обмануть — это было известно и раньше по adversarial-примерам. Ценно тем, что атлас делает уязвимость человекочитаемой: вы видите глазами, за какую текстуру цепляется модель и почему она путается.
Что даёт это на практике
- Отладка датасета. Если сеть связала кита с бейсбольными швами, проблема в данных, а не в архитектуре.
- Поиск ложных корреляций. Модель может решать задачу по фону, а не по объекту — атлас это подсвечивает.
- Оценка устойчивости. Видно заранее, какими текстурами модель проще всего сбить.
Где границы метода
Activation Atlases сделан для свёрточных сетей компьютерного зрения и завязан на пространственную структуру активаций. Механически перенести его на языковые модели или трансформеры-декодеры не выйдет — там нет той же двумерной решётки активаций, и интерпретируемость строится иначе.
Второе ограничение — субъективность чтения. Атлас показывает образы, но выводы о том, что именно значит та или иная область, делает человек. Это инструмент для гипотез, а не автоматический вердикт.
| Метод | Что показывает | Масштаб |
|---|---|---|
| Feature visualization | На что реагирует один нейрон | Один нейрон |
| Attribution (saliency) | Какие пиксели входа важны для ответа | Один вход |
| Activation Atlases | Словарь понятий слоя целиком | Слой / класс |
Почему это важно за пределами картинок
Работа стала одним из заметных шагов в области mechanistic interpretability — попытке разобрать нейросеть не как чёрный ящик по метрикам качества, а как механизм, чьи детали можно назвать и проверить. Тот же круг исследователей позже перешёл к разбору внутренностей языковых моделей, и логика осталась прежней: сначала найти интерпретируемые единицы, потом показать, как они складываются в поведение.
Для инженера практический вывод один: точность на тестовой выборке не говорит, по каким признакам модель приняла решение. Инструменты вроде Activation Atlases отвечают на второй вопрос — и иногда ответ неприятный.
* UMAP (Uniform Manifold Approximation and Projection) — алгоритм снижения размерности, который раскладывает многомерные данные на плоскости так, чтобы близкие точки оставались близкими. Используется для визуализации, как и t-SNE, но обычно быстрее и лучше сохраняет глобальную структуру.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Activation Atlas — Distill.pub, Introducing Activation Atlases — OpenAI Blog
Частые вопросы
На какой модели построены Activation Atlases?
Можно ли применить атлас к языковым моделям вроде GPT?
Атлас показывает, что нейросеть легко обмануть — это опасно?
Чем это отличается от saliency-карт?
Нужны ли для построения атласа собственные вычислительные мощности?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.