Gemma Scope 2: как разобрать языковую модель по слоям
Google DeepMind выкатила новый набор разреженных автоэнкодеров для семейства Gemma. Инструмент показывает, какие внутренние признаки активируются внутри модели — от понятия «Париж» до попытки обмана.

Языковая модель выдаёт ответ, но что происходит между промптом и текстом на выходе — чёрный ящик из миллиардов чисел. Google DeepMind предлагает способ заглянуть внутрь: набор инструментов интерпретируемости, который раскладывает активации Gemma на понятные человеку признаки. Идея не новая — линейка Gemma Scope открылась ещё в 2024 году и включала сотни разреженных автоэнкодеров. Новая волна расширяет покрытие на более крупные версии модели и упрощает поиск конкретных концептов. Для сообщества AI safety это рабочий инструмент, а не демо: с ним можно проверять, реагирует ли модель на понятие «обман» или «медицинский совет», прежде чем она сгенерирует ответ.
Что вообще пытаются увидеть
Внутри трансформера каждый токен превращается в вектор из тысяч чисел. Проблема в том, что один нейрон почти никогда не отвечает за одну идею — он реагирует одновременно на десятки не связанных между собой вещей. Это называют полисемантичностью, и именно она мешает читать модель напрямую.
Разреженный автоэнкодер1 обходит проблему: он раскладывает плотный вектор активации на большое число признаков, из которых в каждый момент активна лишь малая доля. В результате появляется словарь: один признак устойчиво загорается на упоминании географии, другой — на коде на Python, третий — на эмоционально заряженных фразах.
Разреженный автоэнкодер не делает модель безопаснее сам по себе. Он делает её читаемой — а дальше уже работа исследователя решить, что с прочитанным делать.
Зачем это safety-сообществу
Практическая ценность в том, что признаки можно не только наблюдать, но и вмешиваться в них. Если усилить признак, отвечающий за отказ выполнять вредную инструкцию, модель охотнее откажется. Если найти признак, коррелирующий с уверенным враньём, можно строить детектор до того, как ответ дойдёт до пользователя.
- поиск признаков, связанных с потенциально опасным поведением — обман, генерация вредных инструкций;
- проверка гипотез: действительно ли модель «понимает» концепт или воспроизводит поверхностную корреляцию;
- эксперименты с редактированием активаций — усиление или подавление отдельных признаков;
- сравнение того, как один и тот же концепт представлен в моделях разного размера.
Что входит в набор
Точный состав релиза и число автоэнкодеров стоит сверять в официальном анонсе Google DeepMind и на карточках моделей — цифры по слоям и размерности словаря меняются от версии к версии. В основе подход остаётся прежним: автоэнкодеры обучены на активациях разных слоёв Gemma и опубликованы под открытой лицензией, чтобы независимые исследователи могли воспроизвести результаты.
Ключевое отличие от закрытых экспериментов вроде интерпретируемости Claude в том, что здесь и модель, и инструменты доступны публично. Вы можете скачать веса, прогнать свой текст и посмотреть, какие признаки загорелись.
| Что сравниваем | Обычный анализ нейронов | Разреженные автоэнкодеры |
|---|---|---|
| Читаемость | Низкая: один нейрон — много смыслов | Высокая: признак ближе к одному концепту |
| Число единиц | Равно размерности слоя | Кратно больше, с разреженной активацией |
| Возможность вмешательства | Грубая | Точечная: усилить или подавить признак |
| Стоимость обучения | Не требуется | Отдельный этап обучения на активациях |
Где проходит граница честности
Метод не даёт гарантий. Признак, который выглядит как «обман», может на деле реагировать на что-то смежное — например, на художественный вымысел или на цитирование чужой лжи. Разреженный автоэнкодер восстанавливает активации с потерями: часть информации о работе модели он просто не улавливает. И признаки, найденные на одной версии Gemma, не переносятся автоматически на другую.
Поэтому корректная формулировка звучит осторожно: инструмент помогает выдвигать и проверять гипотезы о внутренней работе модели, а не выносить окончательный вердикт «модель врёт». Любой громкий вывод из активаций требует отдельной проверки на поведении.
Как начать, если вы исследователь
- Определите слой и модель, с которыми работаете, и найдите соответствующий автоэнкодер в опубликованном наборе.
- Прогоните интересующие вас тексты через Gemma и снимите активации нужного слоя.
- Пропустите активации через автоэнкодер и посмотрите, какие признаки активны.
- Сопоставьте признаки с примерами, на которых они загораются сильнее всего — так вы поймёте, за что признак отвечает.
- Проверьте гипотезу вмешательством: подавите или усильте признак и оцените, как изменился ответ модели.
Отдельный вопрос — масштаб. Интерпретируемость исторически отставала от размера моделей: разбирать по признакам компактную сеть проще, чем фронтир на сотни миллиардов параметров. Открытые инструменты вроде этого не закрывают разрыв целиком, но дают академическим группам без дата-центра шанс работать с настоящими, а не игрушечными моделями. Это и есть цена вопроса: без публичных наборов интерпретируемость остаётся привилегией нескольких крупных лабораторий.
1 Разреженный автоэнкодер (sparse autoencoder, SAE) — нейросеть, которая сжимает вектор активаций в набор признаков и восстанавливает его обратно, при условии что одновременно активна лишь малая доля признаков. Ограничение на разреженность заставляет каждый признак специализироваться на чём-то конкретном.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Google DeepMind — исследования интерпретируемости и Gemma Scope, Gemma — официальная документация и карточки моделей
Частые вопросы
Gemma Scope 2 делает модель безопаснее?
Можно ли доверять признаку, который выглядит как «обман»?
Нужен ли для работы с этим доступ к закрытым весам?
Переносятся ли найденные признаки между версиями модели?
Сколько автоэнкодеров в наборе и на какие слои они обучены?
Подойдёт ли это для учебного проекта без мощного железа?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.