PATE: как обучать нейросети на приватных данных без утечек
Метод PATE позволяет обучить модель на медицинских или финансовых данных так, что по её ответам нельзя восстановить конкретного пациента. Разбираем, как работает перенос знаний через ансамбль учителей и дифференциальную приватность.

Проблема, которую пытается решить PATE
Нейросеть запоминает свои обучающие данные — иногда буквально. В 2017 году группа исследователей показала, что модель, обученную на приватных медицинских записях, можно атаковать так называемой membership inference attack: подавая на вход разные примеры и глядя на уверенность модели, злоумышленник определяет, был ли конкретный человек в обучающей выборке. Для датасета с диагнозами это значит утечку самого факта болезни.
Отсюда конфликт: данных для сильных моделей нужно много, но самые ценные данные — медицинские карты, банковские транзакции, переписка — юридически и этически нельзя выкладывать в общий доступ и рискованно скармливать напрямую в обучение. PATE (Private Aggregation of Teacher Ensembles) — метод, предложенный Николасом Папернотом и соавторами, который развязывает этот узел через двухступенчатый перенос знаний.
Как устроен перенос знаний
Идея в том, чтобы приватные данные никогда не участвовали в обучении той модели, которую вы потом публикуете. Вместо этого они обучают промежуточных «учителей», а наружу выходит только «ученик», видевший исключительно публичные, неразмеченные данные.
Шаг 1: ансамбль учителей
Приватный датасет режется на несколько непересекающихся частей — например, на сотни. На каждой части обучается отдельная модель-учитель. Ключевой момент: разбиение непересекающееся, поэтому ни один пример приватных данных не влияет больше чем на одного учителя.
Шаг 2: зашумлённое голосование
Чтобы разметить новый (публичный) пример, его показывают всем учителям. Каждый выдаёт свой класс. Дальше считаются голоса по классам — и в этот счётчик добавляется случайный шум по распределению Лапласа. Только после этого выбирается класс с максимальным зашумлённым числом голосов.
Шум в голосовании — не косметика, а математическая гарантия. Именно он не даёт по одному ответу ансамбля понять, как проголосовал конкретный учитель, а значит, и что лежало в его куске приватных данных.
Шаг 3: обучение ученика
Ученик учится на публичных примерах, размеченных этим зашумлённым голосованием. Дальше в продакшн отправляется только ученик. Учителей и приватные данные можно запереть за периметром — наружу они не выходят вообще.
Причём здесь дифференциальная приватность
PATE опирается на дифференциальную приватность* — формальную гарантию того, что присутствие или отсутствие одной записи в датасете почти не меняет итоговый результат. Каждый запрос ученика к ансамблю «тратит» часть приватного бюджета, обозначаемого греческой буквой ε (эпсилон): чем меньше ε, тем сильнее защита и тем больше шума.
Тонкость PATE в том, что расход бюджета зависит от согласия учителей. Если почти все учителя проголосовали за один класс, шум почти не влияет на исход, и такой запрос стоит дёшево с точки зрения приватности. Спорные примеры, где голоса размазаны, обходятся дороже. Улучшенная версия метода (PATE с механизмом на основе распределения Гаусса и «доверенным агрегатором») использует это, чтобы получать сильные гарантии при меньшем шуме.
Что показали эксперименты
На классических бенчмарках метод дал точность, близкую к обычному обучению, при осмысленных значениях ε. По данным авторов, на MNIST ученик достиг точности около 98% при ε порядка единиц, на SVHN — около 90%. Это важно: приватность здесь не убивает качество до неюзабельного уровня, а стоит нескольких процентных пунктов.
Сравнение с альтернативами
| Подход | Что защищает | Цена |
|---|---|---|
| DP-SGD (зашумлённый градиентный спуск) | Одну обученную модель напрямую | Шум в градиентах, часто заметная просадка точности |
| PATE | Приватные данные через посредника-ученика | Нужны публичные неразмеченные данные и много учителей |
| Федеративное обучение | Данные остаются на устройствах | Само по себе не даёт формальной гарантии без добавления DP |
Прямого «победителя» здесь нет. DP-SGD не требует публичного датасета и проще в развёртывании. PATE выигрывает, когда у вас есть доступ к неразмеченным публичным данным той же природы, а разметка — единственное, что упирается в приватность.
Где это применимо на практике
- Медицина. Больницы обучают учителей на своих картах, наружу отдаётся общая модель-ученик. Приватные записи не покидают периметр учреждения.
- Финтех. Модель скоринга или антифрода, обученная так, чтобы по ней нельзя было восстановить транзакции конкретного клиента.
- Данные с устройств. Сценарии, где несколько владельцев данных (несколько дата-центров, регионов, партнёров) не готовы объединять сырые данные, но готовы объединить размеченные голоса.
Ограничения, о которых стоит знать
PATE не бесплатен. Ему нужен публичный неразмеченный датасет — если его нет, метод неприменим. Число учителей должно быть большим, иначе на каждого приходится слишком мало данных и качество учителей падает. Приватный бюджет конечен: после определённого числа запросов к ансамблю гарантии перестают быть содержательными, поэтому ученика обучают на ограниченном наборе примеров.
И главное: дифференциальная приватность защищает от вывода о конкретной записи, но не отменяет ответственности за законность самого сбора данных. Формальная гарантия ε — это про модель, а не про согласие пользователя на обработку.
* Дифференциальная приватность — математическое свойство алгоритма: его результат почти не меняется от добавления или удаления одной записи в исходных данных. Степень защиты задаётся параметром ε — чем он меньше, тем строже гарантия.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Papernot et al., Semi-supervised Knowledge Transfer for Deep Learning from Private Training Data (arXiv), Papernot et al., Scalable Private Learning with PATE (arXiv)
Частые вопросы
Чем PATE отличается от простого добавления шума в данные?
Можно ли восстановить приватные данные по опубликованному ученику?
Сколько учителей нужно для рабочей системы?
Нужны ли публичные данные обязательно?
Заменяет ли PATE соблюдение закона о персональных данных?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.