Почему безопасность ИИ упирается в социологов, а не только в код
Выравнивание моделей всё чаще ломается не на математике, а на людях: чью пользу оптимизировать, как собирать оценки и почему разметчики не согласны друг с другом.

Когда OpenAI дообучала модели на человеческих оценках, выяснилась неудобная вещь: два разметчика, глядя на один и тот же ответ, ставили ему разные оценки примерно в каждом четвёртом-пятом случае. Это не баг в интерфейсе и не плохая инструкция. Это ровно та точка, где безопасность искусственного интеллекта перестаёт быть задачей для инженеров и становится задачей для людей, которые профессионально изучают людей — социологов, психологов, экономистов, специалистов по опросам.
Идею, что AI safety нужны социальные учёные, ещё в 2019 году сформулировали Джеффри Ирвинг и Аманда Аскелл в тексте на блоге OpenAI «AI Safety Needs Social Scientists». С тех пор аргумент стал только острее: чем мощнее модели, тем сильнее их поведение зависит не от архитектуры, а от того, как именно мы измеряем «хороший ответ» и чьё мнение считаем эталоном.
В чём собственно проблема
Современные большие модели дообучают методом обучения с подкреплением на человеческой обратной связи (RLHF)1. Схема упрощённо такая: модель генерирует варианты ответа, люди сравнивают их между собой, на этих сравнениях обучается модель вознаграждения, а затем она направляет дообучение основной модели.
Вся конструкция держится на предположении, что человеческие оценки — надёжный сигнал. На практике это предположение протекает сразу в нескольких местах:
- Люди устают, торопятся и оценивают по-разному в начале и в конце смены.
- Разметчики не эксперты в теме вопроса — по медицине или праву они оценивают правдоподобность, а не правильность.
- Убедительный, но неверный ответ часто получает более высокую оценку, чем корректный, но сухой. Модель учится звучать хорошо, а не быть правой.
- Инструкции для разметки написаны инженерами, которые не всегда представляют, как формулировка вопроса меняет ответ.
Последний пункт — прямая вотчина социальных наук. Полвека методологии опросов накопили знание о том, как порядок вариантов, формулировка шкалы и контекст искажают ответы. Команды, которые пишут гайдлайны для разметчиков, эти грабли проходят заново.
Что именно умеют социальные учёные
Ирвинг и Аскелл предлагали конкретную роль: ставить эксперименты с людьми, чтобы понять, при каких условиях человеческая оценка вообще заслуживает доверия. Речь не о философии, а о прикладной работе.
Прежде чем полагаться на человеческие суждения для обучения ИИ, стоит выяснить, насколько эти суждения устойчивы, воспроизводимы и не подвержены манипуляции. Это эмпирический вопрос, а не аксиома.
Три направления, где вклад заметнее всего:
Дизайн эксперимента
Как сравнить два ответа модели так, чтобы результат не зависел от того, какой показали первым. Как измерить, насколько оценщика можно переубедить неверным, но красноречивым аргументом. Это классический экспериментальный дизайн, которому учат психологов.
Согласованность оценщиков
Метрики межэкспертной согласованности пришли из социологии и медицины задолго до ИИ. Если разметчики систематически расходятся, модель вознаграждения учится на шуме — и никакое увеличение датасета это не чинит.
Агрегация предпочтений
Чьё мнение усреднять и с какими весами — вопрос из теории общественного выбора и экономики благосостояния. У него, как показал ещё Эрроу, нет идеального решения, но есть плохие и менее плохие.
Инженеры и социологи смотрят на разное
| Аспект | Взгляд инженера | Взгляд социального учёного |
|---|---|---|
| Данные разметки | Больше примеров — лучше модель | Больше шума — хуже сигнал, даже при росте объёма |
| Расхождение оценщиков | Технический шум, усредняем | Сигнал о неоднозначности задачи, изучаем причину |
| Инструкция разметчику | Понятна, значит работает | Формулировка меняет распределение ответов |
| «Хороший ответ» | Максимум оценки модели вознаграждения | Чья польза, в каком контексте, с чьей точки зрения |
Дебаты как способ проверки
Отдельный сюжет — эксперименты, где человек оценивает не ответ модели напрямую, а спор двух моделей, каждая из которых защищает свою позицию. Идея в том, что человеку легче судить дебаты, чем разбираться в вопросе самому. Но работает ли это, зависит от того, как люди реагируют на аргументы: поддаются ли они более уверенному тону, замечают ли подмену тезиса, устают ли к концу.
Ответить на это может только эмпирика с живыми участниками — то есть эксперимент, спланированный по правилам поведенческой науки, а не по интуиции разработчика.
Что это значит для рынка
Крупные лаборатории уже нанимают людей с гуманитарным и социально-научным бэкграундом в команды alignment и policy. Это не благотворительность и не PR: качество модели вознаграждения напрямую упирается в качество человеческих данных, а данными управляют методологи.
- Расходы на разметку растут, и экономить хочется без потери качества — тут нужен человек, который отличит дешёвый шум от дорогого сигнала.
- Регуляторы всё чаще спрашивают, чьи ценности зашиты в модель — на это отвечает не архитектура, а процедура сбора предпочтений.
- Ошибки выравнивания дороги репутационно: модель, которую легко переубедить в опасную сторону, — это провал именно человеко-машинного интерфейса.
Если коротко: код решает, что модель может сделать. Люди и то, как мы их спрашиваем, решают, что модель считает хорошим. Второе последнее время оказывается узким местом.
1 RLHF (reinforcement learning from human feedback) — обучение с подкреплением на человеческой обратной связи: способ дообучить модель так, чтобы её ответы соответствовали человеческим предпочтениям, собранным через сравнение вариантов.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: AI Safety Needs Social Scientists — OpenAI
Частые вопросы
Разве нельзя заменить людей другой моделью, которая оценивает ответы?
Почему расхождение разметчиков нельзя просто усреднить?
Это про этику ИИ или про инженерию?
Каким специалистам стоит смотреть в сторону AI safety?
Насколько это реальная практика, а не теория?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.