Безопасность ИИ: почему лаборатории обязаны договариваться
Гонка за AGI превратилась в гонку релизов, где на безопасность остаётся всё меньше времени. Разбираем, почему одиночные усилия лабораторий уже не работают и что предлагают Anthropic, OpenAI и DeepMind.

Летом 2024 года OpenAI распустила команду Superalignment — ту самую, что должна была решить проблему управления сверхчеловеческим ИИ. Ян Лейке, её сооснователь, ушёл в Anthropic с публичным заявлением: культура безопасности отступила на задний план перед блестящими продуктами. Через год Anthropic и OpenAI впервые провели совместное тестирование своих моделей на предмет опасного поведения. Это первый случай, когда прямые конкуренты добровольно открыли друг другу закрытые оценочные наборы.
Пока публика спорит, умеет ли GPT-5 писать стихи лучше Claude, внутри лабораторий обсуждают другое: как не выпустить модель, которая поможет собрать биологическое оружие или обойдёт собственные ограничения. И здесь одиночная работа больше не тянет.
Почему безопасность нельзя делать в одиночку
Логика простая. Если Anthropic тратит на red-teaming модели полгода, а конкурент выпускает аналогичную возможность за месяц — рынок наградит конкурента. Пользователи уйдут туда, где быстрее. Инвесторы — тоже. Это классическая дилемма заключённого: осторожность каждого ослабляется гонкой всех.
Второй момент — техника. Оценки опасных способностей (dangerous capability evaluations) сложны и дороги. Проверка одной модели на способность помочь в создании CBRN-угроз* стоит сотни тысяч долларов и требует экспертов по вирусологии, химии, кибербезопасности. Дублировать эту работу в каждой лаборатории — расточительно и бессмысленно.
Когда четыре лаборатории независимо проверяют модель на одну и ту же угрозу и приходят к разным выводам — это не четыре мнения, это отсутствие науки.
Что уже сделано
- UK AI Safety Institute (сейчас AISI) — получил досрочный доступ к моделям OpenAI, Anthropic, Google DeepMind и Meta до публичного релиза;
- Frontier Model Forum — консорциум Anthropic, Google, Microsoft и OpenAI, обменивается практиками оценки;
- Seoul Declaration (май 2024) — 16 компаний обязались публиковать пороги риска, при которых модель не будет выпущена;
- Совместное тестирование Anthropic и OpenAI (август 2025) — обмен внутренними бенчмарками на sycophancy, jailbreak-устойчивость и опасные способности.
Три модели сотрудничества
Подходы к тому, как лаборатории должны работать вместе, различаются. Условно их три.
| Модель | Кто продвигает | Плюсы | Риски |
|---|---|---|---|
| Государственный аудит | UK AISI, EU AI Office | Независимость, юридическая сила | Медленно, зависит от политики |
| Отраслевой консорциум | Frontier Model Forum | Скорость, техническая экспертиза | Конфликт интересов, закрытость |
| Открытые бенчмарки | METR, Apollo Research | Прозрачность, воспроизводимость | Модели быстро переоснащаются под тест |
Ни одна из моделей не работает сама по себе. Государству не хватает инженеров, консорциуму — доверия, открытым бенчмаркам — рычагов давления. Реалистичный сценарий — комбинация всех трёх.
Сколько это стоит
Оценки Epoch AI: обучение фронтир-модели уровня GPT-4 обошлось примерно в 78 млн долларов, Gemini Ultra — около 191 млн. При этом бюджеты на safety-исследования в тех же компаниях составляют, по открытым оценкам, единицы процентов от общих R&D-расходов. Для сравнения: годовой бюджет UK AISI на 2024 год — около 100 млн фунтов, весь. На всю индустрию.
Простая арифметика: если стоимость обучения растёт в 2–3 раза в год, а расходы на независимый аудит — в лучшем случае линейно, разрыв увеличивается. Через два-три года регулятор физически не сможет проверить то, что выпускает индустрия.
Что мешает договориться
Основных препятствий четыре:
- Антимонопольное право. Обмен информацией между конкурентами в США и ЕС требует юридической обвязки — иначе это картельный сговор.
- Утечка ноу-хау. Метод оценки опасных способностей часто раскрывает архитектурные детали модели.
- Геополитика. Договорённости западных лабораторий не распространяются на китайские — DeepSeek, Qwen, Kimi развиваются в другой правовой среде.
- Отсутствие санкций. Все нынешние обязательства добровольные. Компания, нарушившая Seoul Declaration, не несёт никакой ответственности, кроме репутационной.
Пример: как выглядит совместная оценка на практике
# Упрощённая схема кросс-лабораторного теста
for model in [claude_opus, gpt_5, gemini_ultra]:
for eval_suite in [cbrn_uplift, cyber_offense, autonomy]:
score = run_eval(model, eval_suite, evaluator="third_party")
if score > threshold[eval_suite]:
trigger_review(model, eval_suite)
delay_release(model)На бумаге просто. На практике каждая строка — предмет переговоров: кто такой third_party, какой threshold считать безопасным, что значит delay_release, если акционеры ждут релиза к квартальному отчёту.
Что дальше
Ближайшая развилка — 2025–2026 годы. Если крупные лаборатории смогут договориться о единых порогах опасности и передать проверку независимой стороне, у регуляторов появится основа для законов. Если нет — законы напишут без них, и качество этих законов предсказать несложно.
Читателю, который работает с ИИ на уровне API или продукта, стоит следить за двумя вещами: публикацией system cards с реальными оценками рисков (а не маркетинговыми абзацами) и появлением независимых бенчмарков от METR, Apollo Research и AISI. Именно там сейчас формируется отраслевой стандарт — тот, который через пару лет станет требованием закупок и compliance.
* CBRN — Chemical, Biological, Radiological, Nuclear. Категория угроз, при которой ИИ может дать нетривиальную помощь в создании оружия массового поражения.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Findings from a Pilot Anthropic–OpenAI Alignment Evaluation Exercise, Frontier AI Safety Commitments, AI Seoul Summit 2024
Частые вопросы
Разве совместное тестирование не раскроет коммерческие секреты лабораторий?
Почему нельзя оставить безопасность рынку — плохие модели просто не будут покупать?
Что даёт добровольная декларация вроде Seoul Declaration, если санкций нет?
Китайские лаборатории участвуют в этих соглашениях?
Насколько подорожают модели из-за требований безопасности?
Есть ли смысл разработчику продукта следить за safety-повесткой?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту. Компания Meta Platforms Inc. признана в России экстремистской организацией; её деятельность на территории Российской Федерации запрещена.