
Prompt injection: почему агенты уязвимы и как их защищать
LLM-агенты с доступом к почте, файлам и API читают текст из внешних источников — и слепо ему подчиняются. Разбираем, как работает prompt injection и какие защиты реально снижают риск.

LLM-агенты с доступом к почте, файлам и API читают текст из внешних источников — и слепо ему подчиняются. Разбираем, как работает prompt injection и какие защиты реально снижают риск.

Агент отлично пишет одну функцию, но разваливается на цепочке из сорока шагов. Разбираем, где именно ломается длинная задача — контекст, накопление ошибок, потеря цели — и что с этим делают.

Открытые модели вроде Llama 3.3, Qwen 2.5 и DeepSeek-V3 всё чаще запускают на своём железе под агентские задачи. Разбираемся, где это экономит деньги и данные, а где превращается в дорогую головную боль.

Классический RAG достаёт куски документов и вклеивает их в промпт. Agentic RAG добавляет модель-агента, которая сама решает, где искать, сколько раз и стоит ли уточнить запрос. Разбираем, чем это отличается и где оправдано.

Модель в 4-битном квантовании отвечает в чате почти как оригинал, но в цепочке из десяти шагов с вызовами инструментов начинает ошибаться в аргументах и терять формат. Разбираем, где именно ломается точность и что с этим делать.

Модели вроде GPT-4o, Gemini и Claude научились разбирать картинки, скриншоты и звук в одном запросе. Разбираем, что реально работает, что пока сырое и во сколько это обходится.

Агенты дёргают модель по одним и тем же вопросам десятки раз в день. Семантическое кеширование ловит похожие запросы и отдаёт готовый ответ, экономя на токенах и латентности. Разбираем, где это работает, а где ломается.

Агент проходит финальный тест, но по пути выдумывает факты и лишний раз дёргает платный API. Разбираем, что и чем измерять в цепочке рассуждений, а не только на выходе.

Агент проходит демо и падает на реальном пользователе. Разбираем, какие граничные случаи ломают LLM-агентов и как строить тесты, которые ловят провалы до продакшена.

Промпт — это часть логики приложения, но чаще всего он живёт вне контроля версий. Разбираем, как отслеживать изменения агентов и промптов и откатываться, когда обновление ломает ответы.

Агент отправил платёж, не дождался ответа сети, повторил запрос — и деньги ушли дважды. Разбираем, как ретраи ломают действия агентов и что с этим делают ключи идемпотентности.

Языковые модели знают мир на момент обучения, а не на сегодня. Разбираем, откуда берётся устаревшая информация в ответах агентов, как это чинят RAG и веб-поиск и где заканчивается их помощь.