OpenAI Scholars 2021: чему за полгода научились девять исследователей
Программа OpenAI Scholars завершилась девятью проектами — от интерпретации CLIP до генерации музыки. Разбираем, что именно сделали участники и зачем эти результаты нужны индустрии.

Программа OpenAI Scholars — шестимесячная стажировка для людей из недопредставленных в ИИ-исследованиях групп. В 2021 году девять участников работали удалённо с менторами из OpenAI, а по итогам представили финальные проекты: от анализа нейронов CLIP до дообучения GPT под конкретные задачи. Формат для тех, кто уже умеет программировать, но раньше не занимался ресёрчем всерьёз.
Что такое Scholars и зачем это OpenAI
Scholars запустили в 2018 году. Участникам платят стипендию, дают вычислительные ресурсы и закрепляют ментора — действующего исследователя компании. За полгода каждый выбирает тему, ведёт блог с промежуточными отчётами и в финале выкладывает проект. Формально это не наём, но часть выпускников прошлых лет позже присоединились к OpenAI и Anthropic.
Для компании это дешёвый способ расширить круг людей, знакомых с внутренней исследовательской культурой. Для участников — редкий шанс поработать с крупными моделями, к которым иначе не подступиться: доступ к API и вычислениям в 2021 году стоил ощутимых денег.
Условия программы
- длительность — 6 месяцев, полный день;
- стипендия — порядка 10 тысяч долларов в месяц (сумма от года к году менялась, точную цифру за 2021-й OpenAI публично не фиксировала);
- кредиты на вычисления и доступ к API;
- ментор из числа исследователей OpenAI;
- обязательные публичные блог-посты и финальный проект.
Девять проектов 2021 года
Темы участники выбирали сами, поэтому список получился разношёрстный: интерпретируемость, безопасность, генерация, дообучение. Ниже — сводка по направлениям.
| Участник | Тема | Модель / подход |
|---|---|---|
| Cathy Yeh | Обнаружение предвзятости в языковых моделях | GPT-3, зондирование |
| Danielle Ensign | Обучение агентов через демонстрации человека | RL + imitation learning |
| Ellie Kitanidis | Few-shot обучение для научных задач | GPT-3, prompt engineering |
| Florentine Eloundou | Мультимодальные представления | CLIP |
| Jonathan Ward | Генерация музыки | Jukebox, дообучение |
| Kudzo Ahegbebu | Робастность классификаторов | Adversarial training |
| Legg Yeung | Интерпретация нейронов CLIP | Feature visualization |
| Sam Gbafa | Диалоговые агенты | Дообучение GPT-3 |
| Shola Oyedele | Токенизация для языков с ограниченными ресурсами | BPE, африканские языки |
Полные имена и темы — из официального анонса OpenAI. Некоторые проекты позже переросли в отдельные публикации, часть осталась в формате блог-постов.
Три работы, на которые стоит посмотреть внимательнее
Токенизация для африканских языков
Shola Oyedele разбирала, почему стандартные BPE-токенизаторы дают чудовищно длинные последовательности для языков вроде йоруба и суахили. Для английского типичное слово укладывается в 1–2 токена, для йоруба — в 5–8. Это напрямую бьёт по стоимости: при тарификации по токенам генерация текста на африканском языке через GPT-3 обходилась в разы дороже, чем на английском, при худшем качестве.
Токенизатор — не техническая мелочь, а фактор, который определяет, кто может позволить себе пользоваться моделью, а кто нет.
Интерпретация нейронов CLIP
Legg Yeung продолжил линию, начатую командой OpenAI Clarity: искал в CLIP «мультимодальные нейроны», которые срабатывают и на изображение объекта, и на слово, его обозначающее. Такие нейроны обнаружились для абстрактных концепций — например, «лето» активирует и фото пляжа, и текст со словом summer. Метод — визуализация признаков через оптимизацию входного изображения.
Дообучение Jukebox
Jonathan Ward попробовал адаптировать музыкальную модель Jukebox под конкретный жанр. Основная проблема — вычислительная стоимость: полное обучение Jukebox с нуля требует сотен GPU-часов, дообучение — десятков. Автор оценивал компромисс между качеством и бюджетом и пришёл к тому, что для узкого жанра осмысленно замораживать нижние слои и переучивать только верхние.
Что это даёт индустрии
Проекты Scholars редко становятся SOTA-результатами — за полгода это и невозможно. Их ценность в другом:
- Проверяются гипотезы, до которых у штатных команд не доходят руки.
- Появляются готовые блог-посты с воспроизводимым кодом — материал для учебных курсов.
- Формируется кадровый резерв: часть выпускников уходит в исследовательские лаборатории.
Отдельная ценность — работы про языки и данные, недопредставленные в основных бенчмарках. Внутренние команды крупных лабораторий редко берутся за йоруба или тагальский просто потому, что метрики на них никто не считает.
Как попасть в программу
Отбор конкурсный. От кандидата ждут уверенного Python и опыта с PyTorch или TensorFlow, но не требуют академической степени. Заявка включает описание исследовательской идеи и мотивационное письмо. В 2021 году OpenAI отдельно подчёркивала приоритет для женщин, чернокожих исследователей, латиноамериканцев и других недопредставленных групп.
Программа набирается не каждый год — в 2022-м её, например, не проводили в прежнем формате. Актуальные анонсы стоит отслеживать в блоге OpenAI.
Sparse autoencoder — метод разложения активаций нейросети на разреженные интерпретируемые признаки. В 2021 году применялся для CLIP в упрощённой форме — через feature visualization.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: OpenAI Scholars 2021: Final Projects
Частые вопросы
Сколько платят участникам Scholars?
Нужна ли для участия степень PhD?
Программа проходит удалённо?
Что происходит с выпускниками после программы?
Можно ли использовать проекты Scholars в своей работе?
Проводится ли Scholars сейчас?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.