"Контекстные бомбы": как промпты останавливают ИИ-хакеров

Хакеры создали монстра, которого теперь бьют его же дубиной
Есть что-то почти театральное в том, как разворачивается эта история. Промпт-инъекции - любимый инструмент злоумышленников, с помощью которого они заставляли языковые модели сливать данные, обходить защиты и действовать против своих же пользователей. Теперь защитники взяли это оружие и направили его против атакующих ИИ-агентов. Результаты, Впечатляют настолько, что хочется перечитать дважды.
Компания Tracebit опубликовала исследование, в котором описывает технику под названием "context bombing" - "контекстное бомбардирование". Суть проста до элегантности: если рядом с паролями, криптографическими ключами и другими секретами в облачной инфраструктуре AWS разместить специально сконструированный промпт, атакующий ИИ-агент натыкается на него и... просто отключается.
Как работает контекстная бомба
Механизм эксплуатирует те самые защитные барьеры, которые разработчики ИИ встраивают в свои модели. Промпт содержит запрос, нарушающий эти барьеры - например, инструкцию по созданию биологического оружия или, в случае китайских моделей, отсылку к знаменитому "Человеку перед танком" на площади Тяньаньмэнь. Модель отказывается выполнять такую команду - и этот отказ "заражает" весь контекст. Агент перестает продолжать свою задачу и фактически парализуется.
"Мы запускаем механизм отказа прямо в контексте", - объясняет Энди Смит, сооснователь и CEO Tracebit. По его словам, эффект резкий и устойчивый: как только запрещенный контент попадает в контекстное окно агента, тот продолжает отказываться снова и снова.
Цифры, которые говорят сами за себя
Tracebit тестировал технику на пяти моделях - Opus 4.8, Gemini 3.1 Pro, GLM 5.2, DeepSeek 4 Pro и Kimi 2.6 - в симулированной среде AWS. Всего было проведено 152 атакующих прогона. Результаты:
- Успешная эскалация до прав администратора упала с 57% до 5% - Полная компрометация с закреплением в системе - с 36% до 1% - Доля прогонов, где агент хоть как-то продвинулся по пути атаки - с 91% до 15% - Среднее количество успешно пройденных путей атаки - с 1,53 до 0,16
Особенно показателен результат для Opus 4.8 - самого мощного агента в тесте. Без защиты он достигал прав администратора в 93% случаев. С контекстной бомбой - ни разу. Ноль из ноля. Это не просто хорошая статистика, это разгром.
Контекст важнее: откуда растут ноги
Это исследование - продолжение майской работы Tracebit, когда компания представила систему "канареечных" ресурсов в AWS. Идея та же, что у шахтерских канареек: разместить в инфраструктуре ловушки-приманки, неотличимые от реальных ресурсов, но на самом деле никем не используемые. Как только ИИ-агент начинает их зондировать - защитники получают тревогу. В среднем предупреждение приходило за 8 минут до того, как агент успевал эскалировать привилегии (а на это ему требовалось около 14 минут).
Шесть минут форы - это неплохо, но нервно. Именно поэтому понадобилось что-то, что не просто предупреждает, а останавливает. Контекстная бомба решает эту задачу.
Масштаб угрозы: не академическая проблема
Атаки ИИ-агентов - это уже не сценарии из исследовательских лабораторий. По данным CrowdStrike, в 2025 году промпт-инъекции затронули более 90 организаций. ИИ-операции злоумышленников выросли на 89% год к году, и что особенно тревожно - 82% взломов не содержали традиционного вредоносного кода. Промпты стали новым малварем - CrowdStrike так прямо и формулирует этот сдвиг.
Промпт-инъекции занимают первое место в OWASP Top 10 для LLM-приложений уже второй год подряд (позиция LLM01). Причина банальна и от этого не менее опасна: языковые модели не умеют надежно различать инструкции разработчика и текст, подгруженный из внешнего источника - письма, веб-страницы, документа.
Реальные инциденты это подтверждают. В 2024 году атака на Slack AI позволяла через публичный канал извлекать данные из приватных переписок, включая API-ключи. В 2025-м была раскрыта уязвимость EchoLeak (CVE-2025-32711, CVSS 9.3) в Microsoft 365 Copilot - одно специально сформированное письмо без какого-либо взаимодействия пользователя заставляло Copilot пересылать внутренние файлы на сервер атакующего.
Что это значит для индустрии
Техника Tracebit интересна не только своей эффективностью, но и философским поворотом: защита начинает использовать те же механизмы, что и атака. Это своего рода айкидо - использовать силу противника против него самого.
Для команд безопасности в компаниях, развертывающих ИИ-агентов с доступом к облачной инфраструктуре, это практически применимое решение уже сегодня. Разместить специальные строки рядом с реальными секретами в AWS - задача несложная, а потенциальный выигрыш огромен.
Однако я бы не спешил праздновать победу. Атакующие адаптируются. Следующее поколение ИИ-агентов может быть обучено распознавать контекстные бомбы и игнорировать их, или обходить триггеры отказа через многошаговые цепочки рассуждений. Гонка вооружений в мире ИИ-безопасности только начинается - и сегодняшняя защита завтра может стать очередным препятствием, которое нужно обойти.
Тем не менее направление правильное. Если атакующие используют особенности архитектуры LLM как оружие - защитники должны делать то же самое. Tracebit показал, что это работает. Мяч на стороне атакующих.
*Данные о результатах тестирования и масштабе угроз подтверждены несколькими независимыми публикациями.*
Источники
Похожие новости
Ataraxos: ИИ за $8000 разгромил лучшего игрока в Stratego
Нейросеть от команды MIT, CMU, NYU и Stanford победила четырехкратного чемпиона мира по Stratego со счетом 15-1. DeepMind потратил на аналогичную попытку $3-4,5 млн - и уступил большинству топ-игроков.
OpenAI DevDay 2026: Dots, GPT-6.1 Sol и 1,2 млрд пользователей в неделю
OpenAI провела DevDay 2026: автономные агенты Dots, модель GPT-6.1 Sol за пятую часть цены Astra и новый рекорд аудитории ChatGPT.
GPT-6.1 Sol: почти Astra за пятую часть цены
OpenAI представила GPT-6.1 Sol - модель, которая почти догоняет GPT-6 Astra по качеству, но стоит в пять раз дешевле. Кешированный ввод - $0.10 за миллион токенов.