
Как измеряют галлюцинации LLM: бенчмарки на фактичность
Крупные модели уверенно выдают неправду, а универсального теста на честность до сих пор нет. Разбираем, как устроены бенчмарки фактичности и почему их результатам стоит верить с оговорками.

Крупные модели уверенно выдают неправду, а универсального теста на честность до сих пор нет. Разбираем, как устроены бенчмарки фактичности и почему их результатам стоит верить с оговорками.

AlphaFold предсказал структуру более 200 миллионов белков и открыл базу почти всем известным науке организмам. За что дали Нобелевскую премию и где у метода границы.

Пшеница теряет около 6% урожая на каждый градус потепления. Учёные переписывают гены растений точечно — от CRISPR до синтетической биологии. Разбираем, что работает уже сейчас, а что пока в лаборатории.

OpenAI и правительство Великобритании подписали меморандум о сотрудничестве в сфере ИИ — от инфраструктуры дата-центров до внедрения моделей в госсекторе. Разбираем, что это меняет и кто за что платит.

Разработчики ИИ всё чаще открывают модели государственным лабораториям для проверки на опасные способности. Разбираем, что даёт партнёрство с британским институтом и в чём тут спор.

Google обновила линейку аудиомоделей Gemini для распознавания и генерации речи. Разбираем, что меняется для разработчиков голосовых продуктов и где проверить реальные цены и лимиты.

Google DeepMind выкатила новый набор разреженных автоэнкодеров для семейства Gemma. Инструмент показывает, какие внутренние признаки активируются внутри модели — от понятия «Париж» до попытки обмана.

Google обновил генератор видео Veo до версии 3.1: режим Ingredients to Video позволяет собрать сцену из нескольких референсов и удержать один персонаж или объект в кадре. Разбираем, что реально изменилось.

Google представила Gemini 3 Flash — быструю версию флагманской линейки. Разбираем, где она реально уместна, чем отличается от Pro и почему выбор модели теперь считают в токенах.

Google свёл итоги года в исследованиях к восьми направлениям — от медицинских моделей до квантовых чипов. Разбираем, что из этого уже работает, а что осталось лабораторным экспериментом.

Google продвигает режим Gemini Deep Think как инструмент для научных и математических задач, где важна не скорость ответа, а долгие цепочки рассуждений. Разбираем, что это, кому и зачем.

Обычные модели компьютерного зрения работают с плоской картинкой. Подход D4RT добавляет к трём пространственным осям время — и это меняет то, как машина понимает движущуюся сцену.