

Разработчики ИИ обещают безопасность и честность моделей, но проверить эти заявления снаружи почти невозможно. Индустрия начала собирать инструменты, которые превращают обещания в проверяемые факты.

Внедрение LLM в рабочие процессы не всегда даёт прирост производительности. Разбираем, где ИИ действительно ускоряет команды, а где превращается в дорогой генератор технического долга.

Microscope от OpenAI — открытая коллекция визуализаций нейронов внутри классических моделей компьютерного зрения. Инструмент до сих пор используют в интерпретируемости, хотя обновлений давно нет.

GPT-подобные модели пишут доказательства на Lean и Coq не хуже аспирантов-математиков на простых задачах. Разбираем, как это устроено, сколько стоит и почему до серьёзной математики ещё далеко.

Исследование OpenAI 2020 года показало: модель на 1,3 млрд параметров, обученная на человеческих оценках, пишет краткие пересказы лучше модели в 10 раз больше. Ключ — обучение с подкреплением по фидбеку людей.

Классические тесты на устойчивость проверяют модели против атак, которые уже известны. Но в реальности злоумышленник придумывает что-то новое. Разбираем, как индустрия учится к этому готовиться.

Гонка за AGI превратилась в гонку релизов, где на безопасность остаётся всё меньше времени. Разбираем, почему одиночные усилия лабораторий уже не работают и что предлагают Anthropic, OpenAI и DeepMind.

В апреле 2019 года OpenAI собрала исследователей робототехники, чтобы обсудить, как обучать машины в симуляции и переносить навыки в реальный мир. Главным экспонатом стала рука Dactyl, собирающая кубик Рубика.

HumanEval, MBPP, SWE-bench, LiveCodeBench — что стоит за цифрами в анонсах Codex, Claude и GPT. Разбираем, какие бенчмарки показывают реальные навыки модели, а какие давно протекли в обучающие данные.

В 2019 году OpenAI показала, как роборука Shadow Dactyl решает кубик Рубика. Проект закрыли через два года, но именно он задал спор о том, где предел обучения роботов в симуляции.

Procgen проверяет, умеет ли агент обобщать опыт на новые уровни. MineRL — способен ли он выкопать алмаз в Minecraft за 8 миллионов шагов. Оба ответа неудобны для современных методов.

Почему GPT-3 недоучили, сколько токенов нужно на параметр и где предел кривой качества. Разбираем работы OpenAI и DeepMind, которые задали правила игры для всей индустрии.