«Контекстные бомбы»: как промпты останавливают ИИ-хакеров

Хакеры создали монстра, которого теперь бьют его же дубиной
Есть что-то почти театральное в том, как разворачивается эта история. Промпт-инъекции — любимый инструмент злоумышленников, с помощью которого они заставляли языковые модели сливать данные, обходить защиты и действовать против своих же пользователей. Теперь защитники взяли это оружие и направили его против атакующих ИИ-агентов. Результаты, честно говоря, впечатляют настолько, что хочется перечитать дважды.
Компания Tracebit опубликовала исследование, в котором описывает технику под названием «context bombing» — «контекстное бомбардирование». Суть проста до элегантности: если рядом с паролями, криптографическими ключами и другими секретами в облачной инфраструктуре AWS разместить специально сконструированный промпт, атакующий ИИ-агент натыкается на него и... просто отключается.
Как работает контекстная бомба
Механизм эксплуатирует те самые защитные барьеры, которые разработчики ИИ встраивают в свои модели. Промпт содержит запрос, нарушающий эти барьеры — например, инструкцию по созданию биологического оружия или, в случае китайских моделей, отсылку к знаменитому «Человеку перед танком» на площади Тяньаньмэнь. Модель отказывается выполнять такую команду — и этот отказ «заражает» весь контекст. Агент перестаёт продолжать свою задачу и фактически парализуется.
«Мы запускаем механизм отказа прямо в контексте», — объясняет Энди Смит, сооснователь и CEO Tracebit. По его словам, эффект резкий и устойчивый: как только запрещённый контент попадает в контекстное окно агента, тот продолжает отказываться снова и снова.
Цифры, которые говорят сами за себя
Тracebit тестировал технику на пяти моделях — Opus 4.8, Gemini 3.1 Pro, GLM 5.2, DeepSeek 4 Pro и Kimi 2.6 — в симулированной среде AWS. Всего было проведено 152 атакующих прогона. Результаты:
- Успешная эскалация до прав администратора упала с 57% до 5% - Полная компрометация с закреплением в системе — с 36% до 1% - Доля прогонов, где агент хоть как-то продвинулся по пути атаки — с 91% до 15% - Среднее количество успешно пройденных путей атаки — с 1,53 до 0,16
Особенно показателен результат для Opus 4.8 — самого мощного агента в тесте. Без защиты он достигал прав администратора в 93% случаев. С контекстной бомбой — ни разу. Ноль из ноля. Это не просто хорошая статистика, это разгром.
Контекст важнее: откуда растут ноги
Это исследование — продолжение майской работы Tracebit, когда компания представила систему «канареечных» ресурсов в AWS. Идея та же, что у шахтёрских канареек: разместить в инфраструктуре ловушки-приманки, неотличимые от реальных ресурсов, но на самом деле никем не используемые. Как только ИИ-агент начинает их зондировать — защитники получают тревогу. В среднем предупреждение приходило за 8 минут до того, как агент успевал эскалировать привилегии (а на это ему требовалось около 14 минут).
Шесть минут форы — это неплохо, но нервно. Именно поэтому понадобилось что-то, что не просто предупреждает, а останавливает. Контекстная бомба решает эту задачу.
Масштаб угрозы: не академическая проблема
Важно понимать, что атаки ИИ-агентов — это уже не сценарии из исследовательских лабораторий. По данным CrowdStrike, в 2025 году промпт-инъекции затронули более 90 организаций. ИИ-операции злоумышленников выросли на 89% год к году, и что особенно тревожно — 82% взломов не содержали традиционного вредоносного кода. Промпты стали новым малварем — CrowdStrike так прямо и формулирует этот сдвиг.
Промпт-инъекции занимают первое место в OWASP Top 10 для LLM-приложений уже второй год подряд (позиция LLM01). Причина банальна и от этого не менее опасна: языковые модели не умеют надёжно различать инструкции разработчика и текст, подгруженный из внешнего источника — письма, веб-страницы, документа.
Реальные инциденты это подтверждают. В 2024 году атака на Slack AI позволяла через публичный канал извлекать данные из приватных переписок, включая API-ключи. В 2025-м была раскрыта уязвимость EchoLeak (CVE-2025-32711, CVSS 9.3) в Microsoft 365 Copilot — одно специально сформированное письмо без какого-либо взаимодействия пользователя заставляло Copilot пересылать внутренние файлы на сервер атакующего.
Что это значит для индустрии
Техника Tracebit интересна не только своей эффективностью, но и философским поворотом: защита начинает использовать те же механизмы, что и атака. Это своего рода айкидо — использовать силу противника против него самого.
Для команд безопасности в компаниях, развёртывающих ИИ-агентов с доступом к облачной инфраструктуре, это практически применимое решение уже сегодня. Разместить специальные строки рядом с реальными секретами в AWS — задача несложная, а потенциальный выигрыш огромен.
Однако я бы не спешил праздновать победу. Атакующие адаптируются. Следующее поколение ИИ-агентов может быть обучено распознавать контекстные бомбы и игнорировать их, или обходить триггеры отказа через многошаговые цепочки рассуждений. Гонка вооружений в мире ИИ-безопасности только начинается — и сегодняшняя защита завтра может стать очередным препятствием, которое нужно обойти.
Тем не менее направление правильное. Если атакующие используют особенности архитектуры LLM как оружие — защитники должны делать то же самое. Tracebit показал, что это работает. Мяч на стороне атакующих.
*Данные о результатах тестирования и масштабе угроз подтверждены несколькими независимыми публикациями.*
Источники
Похожие новости
OpenAI распустила команду по катастрофическим рискам ИИ
OpenAI тихо ликвидировала отдел Preparedness, который оценивал угрозы от собственных моделей. Сотрудники говорят о нарастающем «чувстве тревоги и ответственности».
Optima: бенчмарки ИИ наконец-то на ваших реальных данных
Artificial Analysis запустила платформу Optima, которая позволяет строить персональные бенчмарки для LLM на основе собственных данных и сравнивать модели не только по качеству, но и по стоимости задачи.
ИИ-книги затопили Amazon и режут доходы живых авторов
Исследование 14 000 книг показало: ИИ-контент занял 20% каталога, но забирает лишь 12% выручки — зато тянет вниз доходы всех авторов без исключения.