Anthropic и AI Security Institute: зачем правительство тестирует чужие модели
Разработчики ИИ всё чаще открывают модели государственным лабораториям для проверки на опасные способности. Разбираем, что даёт партнёрство с британским институтом и в чём тут спор.

Крупные разработчики ИИ перестали быть единственными, кто оценивает безопасность собственных моделей. Британский институт безопасности ИИ (AI Security Institute, до 2025 года — AI Safety Institute) получает доступ к моделям до релиза и проверяет их на способности, которые считаются потенциально опасными: помощь в создании биологического или химического оружия, автономное проведение кибератак, обход собственных ограничений. Anthropic — одна из компаний, которая объявила о расширении такого сотрудничества. Что это означает на практике и почему вокруг подобных договорённостей идёт спор — ниже.
Что такое AI Security Institute
Институт создан правительством Великобритании в ноябре 2023 года на волне саммита по безопасности ИИ в Блетчли-парке. Изначально он назывался AI Safety Institute, но в феврале 2025 года был переименован в AI Security Institute — с акцентом на угрозы национальной безопасности, а не на абстрактную «безопасность» вообще.
Формально это подразделение внутри британского правительства, а не независимый регулятор. У него нет полномочий запретить выпуск модели. Его инструмент — техническая экспертиза: институт получает ранний доступ к моделям, прогоняет их через собственные тесты и передаёт результаты разработчику и государству.
Похожие структуры появились и в других странах. В США действует аналогичный центр при Национальном институте стандартов и технологий (NIST); подобные инициативы обсуждались в ЕС и ряде азиатских стран. Точный статус и полномочия каждой из них стоит сверять по официальным сообщениям соответствующих ведомств — они менялись за последние два года.
Зачем компании пускают внешних экспертов к своим моделям
Причин несколько, и не все они альтруистические:
- Независимая проверка. Внутренняя команда безопасности всегда рискует упустить то, что заметит взгляд со стороны с другими сценариями атак.
- Репутация и доверие. Заявление «нашу модель проверял государственный институт» весит больше, чем «мы проверили сами».
- Отношения с регуляторами. Добровольное сотрудничество сейчас — способ повлиять на то, каким будет обязательное регулирование потом.
- Ранний сигнал. Если институт находит опасную способность до релиза, дешевле исправить её, чем отзывать уже выпущенную модель.
Что именно тестируют
Оценки на опасные способности (dangerous capability evaluations) — это не проверка на вежливость чат-бота. Речь о том, насколько модель может помочь в причинении серьёзного вреда. Обычно проверяют несколько направлений.
| Направление | Что проверяют |
|---|---|
| Биология и химия | Может ли модель дать работающие инструкции по созданию опасных агентов, которых нет в открытом доступе |
| Кибербезопасность | Способна ли модель находить уязвимости, писать эксплойты, вести атаку с минимальным участием человека |
| Автономность | Насколько модель может действовать самостоятельно: планировать, использовать инструменты, обходить ограничения |
| Манипуляция | Эффективность в убеждении, обмане, социальной инженерии |
Ключевой вопрос оценки — не «знает ли модель что-то плохое», а «повышает ли она реальный порог возможностей злоумышленника». Информация, которую и так легко найти в поисковике, угрозой не считается. Угроза — это когда модель заметно упрощает то, что раньше требовало редкой экспертизы.
Смысл внешней проверки не в том, чтобы поймать компанию на лжи, а в том, чтобы у общества был хоть один источник данных о рисках модели, не подконтрольный её создателю.
Что даёт расширение партнёрства
Углубление сотрудничества обычно означает не разовую проверку, а постоянный процесс: доступ к моделям на более ранних этапах, к внутренним версиям и промежуточным чекпоинтам, совместную разработку методик тестирования и обмен результатами. Для института это шанс тестировать передовые модели, до которых иначе не добраться. Для компании — встроить внешнюю экспертизу в цикл разработки, а не получать вердикт постфактум.
Где здесь спор
Добровольное сотрудничество выглядит благородно, но у критиков есть возражения, и их стоит знать.
- Добровольность означает право прекратить. Пока участие не закреплено законом, компания может выйти из партнёрства, если результаты станут неудобными.
- Кто контролирует контролёров. Государственный институт внутри правительства — не независимый арбитр. Его приоритеты могут смещаться вслед за политикой.
- Прозрачность результатов. Публикуются ли отчёты целиком или только удобные выдержки — вопрос, который решается в каждом случае отдельно.
- Ресурсы против масштаба. Государственная лаборатория с ограниченным штатом физически не успевает глубоко проверить каждую крупную модель на рынке.
Ни одно из этих возражений не отменяет пользу внешних проверок. Но они объясняют, почему часть исследователей настаивает на переходе от добровольных договорённостей к обязательным требованиям с санкциями за отказ.
Что это значит для обычного пользователя
Напрямую — почти ничего: вы не увидите отчёт института, открывая чат-бот. Косвенно — довольно много. Модель, прошедшая внешнюю оценку на опасные способности, с большей вероятностью не выдаст вам работающую инструкцию по чему-то по-настоящему опасному и с меньшей вероятностью станет инструментом для атаки на ваши же данные. Это часть невидимой инфраструктуры доверия, которая определяет, можно ли пускать ИИ в чувствительные сферы вроде медицины или финансов.
Партнёрства разработчиков с государственными институтами безопасности — это ранняя стадия того, как отрасль пытается регулировать саму себя до того, как это сделают законодатели. Насколько такая модель устойчива, покажут ближайшие годы: либо добровольные проверки станут стандартом де-факто, либо их заменят обязательными требованиями, если добровольности окажется недостаточно.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: AI Security Institute — официальный сайт правительства Великобритании, Anthropic — официальный блог
Частые вопросы
AI Security Institute — это независимая организация?
Может ли институт заставить компанию отозвать модель?
Публикуют ли результаты таких проверок?
Чем отличаются AI Safety Institute и AI Security Institute?
Есть ли похожие институты в других странах?
Как это касается меня как пользователя чат-бота?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.