Верифицируемость в разработке ИИ: как доказать, что модель делает то, что обещает
Разработчики ИИ обещают безопасность и честность моделей, но проверить эти заявления снаружи почти невозможно. Индустрия начала собирать инструменты, которые превращают обещания в проверяемые факты.

Летом 2024 года OpenAI, Anthropic и Google DeepMind подписали с институтами безопасности США и Великобритании соглашения о доступе к моделям до релиза. Формально — прорыв: впервые внешние аудиторы получили ранние веса и API. По факту — джентльменское соглашение без механизмов проверки. Никто снаружи не может убедиться, что тестировалась та же модель, что уходит пользователям, и что её поведение на бенчмарках не подкручено под тест. Это и есть проблема верифицируемости: мы верим лабораториям на слово, а инструментов проверить их слово почти нет.
Что вообще нужно проверять
Верифицируемость в ИИ распадается на несколько независимых задач, и путать их — значит спорить ни о чём. Одно дело — доказать, что модель обучалась на заявленных данных. Другое — что в проде крутится ровно та модель, которую тестировали регуляторы. Третье — что заявленные метрики безопасности получены честно, а не подгонкой под известный бенчмарк.
- Провенанс данных — откуда взяты обучающие тексты, изображения, код и есть ли на них права.
- Провенанс обучения — какие использовались вычисления, гиперпараметры, чекпоинты; повторяем ли результат.
- Идентичность модели в деплое — совпадает ли то, что отвечает пользователю, с тем, что проходило red team.
- Честность оценок — не было ли утечки тестов в трейн, не переобучена ли модель под конкретный бенчмарк.
- Соблюдение внутренних политик — например, обещания не обучаться на данных корпоративных клиентов.
Каждый пункт требует своих технических решений. Общего «сертификата ИИ» не будет — будет набор чек-листов и криптографических следов.
Инструменты, которые уже работают
Model cards и system cards
Формат model card, предложенный Маргарет Митчелл и коллегами ещё в 2018 году, стал стандартом де-факто. Anthropic публикует system cards к каждому релизу Claude, OpenAI — к GPT-4, GPT-4o и o1. Проблема в том, что содержание карточек не стандартизировано и не проверяется третьей стороной: лаборатория пишет о себе то, что считает нужным. Это ближе к пресс-релизу с графиками, чем к аудиторскому отчёту.
Криптографические подписи весов
Хеш весов модели — самый простой способ доказать, что версия A и версия B — одно и то же. Hugging Face уже поддерживает SHA-подписи артефактов. Если лаборатория публикует хеш модели, отданной на аудит, и тот же хеш — модели в API, у внешнего наблюдателя появляется хоть какая-то опора. Пока это делают немногие: большинство закрытых моделей вообще не имеют публичных идентификаторов версий, кроме строкового тега вроде gpt-4-turbo-2024-04-09.
Structured access
Идея, которую продвигают исследователи из GovAI и Centre for the Governance of AI: давать внешним аудиторам не веса, а специальный API с расширенными правами — например, доступ к логитам, возможность выключить фильтры, запускать batch-инференс без rate limit. Это компромисс между открытостью и защитой коммерческой тайны. Британский AI Safety Institute (сейчас AI Security Institute) работает именно так с моделями Anthropic и OpenAI.
Что пока не решено
| Задача | Текущее состояние | Что мешает |
|---|---|---|
| Доказать состав обучающих данных | Только декларации лабораторий | Коммерческая тайна, судебные риски |
| Подтвердить идентичность модели в API | Хеши весов у части open-source релизов | Закрытые модели, тихие обновления, A/B-тесты |
| Гарантировать чистоту бенчмарков | Приватные тестовые сеты, canary-строки | Веб-скрейпинг случайно захватывает тесты |
| Верифицировать вычисления при обучении | Академические прототипы на ZK-proofs | Оверхед на порядки, не масштабируется |
| Проверить соблюдение data-политик | SOC 2, аудиты типа Deloitte | Аудит по документам, а не по коду |
Отдельная головная боль — silent updates. Модель под тем же именем в API может незаметно измениться: OpenAI и Anthropic не раз ловили на том, что качество ответов на одинаковых промптах менялось между неделями без анонсов. Исследования Стэнфорда 2023 года (Chen, Zaharia, Zou) показали дрейф поведения GPT-4 на задачах вроде проверки простоты числа — точность падала с 84% до 51% за три месяца. Для регуляторного аудита это фатально: сертифицировать сегодня и получить другую модель завтра.
Верифицируемость — это не про то, чтобы поверить лаборатории. Это про то, чтобы можно было не верить и всё равно знать, что происходит.
Куда движется индустрия
EU AI Act, вступающий в силу поэтапно до 2027 года, вводит для general-purpose моделей обязательства по документации обучающих данных и оценке системных рисков. Как именно это проверять — регламенты дописываются. В США после отмены Executive Order 14110 в январе 2025-го федеральных требований почти не осталось, но добровольные соглашения с AI Safety Institute продолжают работать.
Что реалистично увидеть в ближайшие два года:
- Стандартизация формата model cards — вероятно, через NIST или ISO/IEC.
- Обязательные хеши весов для моделей, попадающих под регулирование в ЕС.
- Расширение сети AI Safety Institutes и структурированного доступа для них.
- Появление независимых red team компаний с правом публиковать отчёты (аналог финансовых аудиторов).
- Договорные обязательства для B2B-клиентов: логи запросов, гарантии неизменности версии на срок контракта.
Zero-knowledge proofs для обучения ИИ — красивая идея, но пока академическая. Проекты вроде EZKL и Modulus Labs доказывают инференс небольших моделей, но обучение фронтир-модели с проверкой каждого шага займёт больше времени, чем само обучение. В горизонте пяти лет — вряд ли.
Что это меняет для тех, кто использует ИИ
Для компаний, встраивающих LLM в продукт, верифицируемость перестаёт быть абстракцией. Если вы подписали контракт на claude-3-5-sonnet, а через месяц провайдер молча заменил её на новую версию с другим поведением — ваши end-to-end тесты покажут регресс, а SLA формально не нарушен. Практические шаги, которые уже имеет смысл делать:
- Пинить конкретные dated-версии моделей в API, а не общие алиасы.
- Держать собственный regression-набор из 100–500 кейсов и гонять его при каждой смене модели.
- В договоре с провайдером фиксировать право на уведомление за N дней до депрекации версии.
- Для чувствительных сценариев — рассматривать self-hosted open-weight модели: там хеш весов у вас в руках.
Structured access — режим доступа к модели, при котором аудитор получает не сами веса, а специальный API с расширенными правами: снятыми фильтрами, доступом к вероятностям токенов, повышенными лимитами. Позволяет провести содержательную проверку без раскрытия коммерческой тайны.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: UK AI Security Institute — About, Model Cards for Model Reporting (Mitchell et al., 2019)
Частые вопросы
Почему нельзя просто выложить веса и дать всем проверить?
Что такое silent update и почему это проблема?
Реально ли доказать, на каких данных обучалась модель?
Помогают ли open-source модели решить проблему верифицируемости?
Что делать бизнесу прямо сейчас, если стабильность модели критична?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.