T
ИИ-чатPrompt InjectionTracebitAI-безопасностьLLM-атакиAWS

"Контекстные бомбы": как промпты останавливают ИИ-хакеров

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
"Контекстные бомбы": как промпты останавливают ИИ-хакеров

Хакеры создали монстра, которого теперь бьют его же дубиной

Есть что-то почти театральное в том, как разворачивается эта история. Промпт-инъекции - любимый инструмент злоумышленников, с помощью которого они заставляли языковые модели сливать данные, обходить защиты и действовать против своих же пользователей. Теперь защитники взяли это оружие и направили его против атакующих ИИ-агентов. Результаты, Впечатляют настолько, что хочется перечитать дважды.

Компания Tracebit опубликовала исследование, в котором описывает технику под названием "context bombing" - "контекстное бомбардирование". Суть проста до элегантности: если рядом с паролями, криптографическими ключами и другими секретами в облачной инфраструктуре AWS разместить специально сконструированный промпт, атакующий ИИ-агент натыкается на него и... просто отключается.

Как работает контекстная бомба

Механизм эксплуатирует те самые защитные барьеры, которые разработчики ИИ встраивают в свои модели. Промпт содержит запрос, нарушающий эти барьеры - например, инструкцию по созданию биологического оружия или, в случае китайских моделей, отсылку к знаменитому "Человеку перед танком" на площади Тяньаньмэнь. Модель отказывается выполнять такую команду - и этот отказ "заражает" весь контекст. Агент перестает продолжать свою задачу и фактически парализуется.

"Мы запускаем механизм отказа прямо в контексте", - объясняет Энди Смит, сооснователь и CEO Tracebit. По его словам, эффект резкий и устойчивый: как только запрещенный контент попадает в контекстное окно агента, тот продолжает отказываться снова и снова.

Цифры, которые говорят сами за себя

Tracebit тестировал технику на пяти моделях - Opus 4.8, Gemini 3.1 Pro, GLM 5.2, DeepSeek 4 Pro и Kimi 2.6 - в симулированной среде AWS. Всего было проведено 152 атакующих прогона. Результаты:

- Успешная эскалация до прав администратора упала с 57% до 5% - Полная компрометация с закреплением в системе - с 36% до 1% - Доля прогонов, где агент хоть как-то продвинулся по пути атаки - с 91% до 15% - Среднее количество успешно пройденных путей атаки - с 1,53 до 0,16

Особенно показателен результат для Opus 4.8 - самого мощного агента в тесте. Без защиты он достигал прав администратора в 93% случаев. С контекстной бомбой - ни разу. Ноль из ноля. Это не просто хорошая статистика, это разгром.

Контекст важнее: откуда растут ноги

Это исследование - продолжение майской работы Tracebit, когда компания представила систему "канареечных" ресурсов в AWS. Идея та же, что у шахтерских канареек: разместить в инфраструктуре ловушки-приманки, неотличимые от реальных ресурсов, но на самом деле никем не используемые. Как только ИИ-агент начинает их зондировать - защитники получают тревогу. В среднем предупреждение приходило за 8 минут до того, как агент успевал эскалировать привилегии (а на это ему требовалось около 14 минут).

Шесть минут форы - это неплохо, но нервно. Именно поэтому понадобилось что-то, что не просто предупреждает, а останавливает. Контекстная бомба решает эту задачу.

Масштаб угрозы: не академическая проблема

Атаки ИИ-агентов - это уже не сценарии из исследовательских лабораторий. По данным CrowdStrike, в 2025 году промпт-инъекции затронули более 90 организаций. ИИ-операции злоумышленников выросли на 89% год к году, и что особенно тревожно - 82% взломов не содержали традиционного вредоносного кода. Промпты стали новым малварем - CrowdStrike так прямо и формулирует этот сдвиг.

Промпт-инъекции занимают первое место в OWASP Top 10 для LLM-приложений уже второй год подряд (позиция LLM01). Причина банальна и от этого не менее опасна: языковые модели не умеют надежно различать инструкции разработчика и текст, подгруженный из внешнего источника - письма, веб-страницы, документа.

Реальные инциденты это подтверждают. В 2024 году атака на Slack AI позволяла через публичный канал извлекать данные из приватных переписок, включая API-ключи. В 2025-м была раскрыта уязвимость EchoLeak (CVE-2025-32711, CVSS 9.3) в Microsoft 365 Copilot - одно специально сформированное письмо без какого-либо взаимодействия пользователя заставляло Copilot пересылать внутренние файлы на сервер атакующего.

Что это значит для индустрии

Техника Tracebit интересна не только своей эффективностью, но и философским поворотом: защита начинает использовать те же механизмы, что и атака. Это своего рода айкидо - использовать силу противника против него самого.

Для команд безопасности в компаниях, развертывающих ИИ-агентов с доступом к облачной инфраструктуре, это практически применимое решение уже сегодня. Разместить специальные строки рядом с реальными секретами в AWS - задача несложная, а потенциальный выигрыш огромен.

Однако я бы не спешил праздновать победу. Атакующие адаптируются. Следующее поколение ИИ-агентов может быть обучено распознавать контекстные бомбы и игнорировать их, или обходить триггеры отказа через многошаговые цепочки рассуждений. Гонка вооружений в мире ИИ-безопасности только начинается - и сегодняшняя защита завтра может стать очередным препятствием, которое нужно обойти.

Тем не менее направление правильное. Если атакующие используют особенности архитектуры LLM как оружие - защитники должны делать то же самое. Tracebit показал, что это работает. Мяч на стороне атакующих.

*Данные о результатах тестирования и масштабе угроз подтверждены несколькими независимыми публикациями.*

Источники

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости