
Как оценивают языковые модели, которые пишут код
HumanEval, MBPP, SWE-bench, LiveCodeBench — что стоит за цифрами в анонсах Codex, Claude и GPT. Разбираем, какие бенчмарки показывают реальные навыки модели, а какие давно протекли в обучающие данные.

HumanEval, MBPP, SWE-bench, LiveCodeBench — что стоит за цифрами в анонсах Codex, Claude и GPT. Разбираем, какие бенчмарки показывают реальные навыки модели, а какие давно протекли в обучающие данные.

В 2019 году OpenAI показала, как роборука Shadow Dactyl решает кубик Рубика. Проект закрыли через два года, но именно он задал спор о том, где предел обучения роботов в симуляции.

Procgen проверяет, умеет ли агент обобщать опыт на новые уровни. MineRL — способен ли он выкопать алмаз в Minecraft за 8 миллионов шагов. Оба ответа неудобны для современных методов.

Почему GPT-3 недоучили, сколько токенов нужно на параметр и где предел кривой качества. Разбираем работы OpenAI и DeepMind, которые задали правила игры для всей индустрии.

Статья OpenAI 2020 года про GPT-3 показала: языковой модели достаточно нескольких примеров в промпте, чтобы решать задачи без дообучения. Разбираем, что там внутри и почему это важно до сих пор.

Более 300 приложений работают на GPT-3, OpenAI обрабатывает 4,5 миллиарда слов в день. Разбираем, кто и как встраивает модель в продукты и во что это обходится разработчикам.

Кластер в 7500 нод — территория, где ломается почти всё: DNS, etcd, сеть, планировщик. OpenAI прошла этот путь и опубликовала подробный отчёт о боли.

OpenAI предоставила Microsoft эксклюзивную лицензию на GPT-3. Все остальные разработчики остаются с доступом только через API — прямого доступа к весам модели у них нет.

OpenAI объявила о завершении реструктуризации: коммерческое подразделение стало Public Benefit Corporation, а фонд получил долю около 26%. Что это меняет для рынка и разработчиков.
LLM за три года прошли путь от игрушки до инструмента, которым пользуются юристы, программисты и школьники. Разбираем, что у них внутри, где их предел и во сколько обходится час работы.

OpenAI показала метод PALMS: дообучение GPT-3 на выборке из 80 текстов заметно снижает токсичность ответов. Разбираем, что это за подход, где предел и почему это спорно.

Программа OpenAI Scholars завершилась девятью проектами — от интерпретации CLIP до генерации музыки. Разбираем, что именно сделали участники и зачем эти результаты нужны индустрии.