
Языковые модели учатся доказывать теоремы: где предел
GPT-подобные модели пишут доказательства на Lean и Coq не хуже аспирантов-математиков на простых задачах. Разбираем, как это устроено, сколько стоит и почему до серьёзной математики ещё далеко.

GPT-подобные модели пишут доказательства на Lean и Coq не хуже аспирантов-математиков на простых задачах. Разбираем, как это устроено, сколько стоит и почему до серьёзной математики ещё далеко.

Исследование OpenAI 2020 года показало: модель на 1,3 млрд параметров, обученная на человеческих оценках, пишет краткие пересказы лучше модели в 10 раз больше. Ключ — обучение с подкреплением по фидбеку людей.

Классические тесты на устойчивость проверяют модели против атак, которые уже известны. Но в реальности злоумышленник придумывает что-то новое. Разбираем, как индустрия учится к этому готовиться.

Гонка за AGI превратилась в гонку релизов, где на безопасность остаётся всё меньше времени. Разбираем, почему одиночные усилия лабораторий уже не работают и что предлагают Anthropic, OpenAI и DeepMind.

В апреле 2019 года OpenAI собрала исследователей робототехники, чтобы обсудить, как обучать машины в симуляции и переносить навыки в реальный мир. Главным экспонатом стала рука Dactyl, собирающая кубик Рубика.

HumanEval, MBPP, SWE-bench, LiveCodeBench — что стоит за цифрами в анонсах Codex, Claude и GPT. Разбираем, какие бенчмарки показывают реальные навыки модели, а какие давно протекли в обучающие данные.

В 2019 году OpenAI показала, как роборука Shadow Dactyl решает кубик Рубика. Проект закрыли через два года, но именно он задал спор о том, где предел обучения роботов в симуляции.

Procgen проверяет, умеет ли агент обобщать опыт на новые уровни. MineRL — способен ли он выкопать алмаз в Minecraft за 8 миллионов шагов. Оба ответа неудобны для современных методов.

Почему GPT-3 недоучили, сколько токенов нужно на параметр и где предел кривой качества. Разбираем работы OpenAI и DeepMind, которые задали правила игры для всей индустрии.

Статья OpenAI 2020 года про GPT-3 показала: языковой модели достаточно нескольких примеров в промпте, чтобы решать задачи без дообучения. Разбираем, что там внутри и почему это важно до сих пор.

Более 300 приложений работают на GPT-3, OpenAI обрабатывает 4,5 миллиарда слов в день. Разбираем, кто и как встраивает модель в продукты и во что это обходится разработчикам.

Кластер в 7500 нод — территория, где ломается почти всё: DNS, etcd, сеть, планировщик. OpenAI прошла этот путь и опубликовала подробный отчёт о боли.