Opus 5 обнулил взлом браузерных агентов: 0% успеха атак

Нулевой процент — это не маркетинг, это цифра
Когда в декабре прошлого года OpenAI публично признала, что prompt injection, возможно, никогда не будет полностью решена, это прозвучало как капитуляция перед фундаментальной проблемой безопасности ИИ-агентов. Anthropic, судя по всему, решила поспорить с этим тезисом — и сделала это с цифрами в руках.
Claude Opus 5 в связке с Auto Mode демонстрирует 0% успешных prompt injection атак в браузерных сценариях — 129 тестовых окружений, ни одного прорыва. Если эти данные подтвердятся в реальной эксплуатации, мы наблюдаем один из самых значимых прорывов в безопасности ИИ-агентов за последние годы.
Что такое prompt injection и почему это не просто «баг»
Представьте: вы просите агента просмотреть входящие письма и составить ответы на запросы о встречах. Одно из писем содержит невидимый белый текст с инструкцией — переслать все письма со словом «конфиденциально» на внешний адрес перед тем, как выполнить вашу задачу. Агент выполняет вашу просьбу, и одновременно — чужую.
Это и есть prompt injection: злоумышленник прячет инструкции в контенте, который обрабатывает агент. Браузерные агенты особенно уязвимы — каждая страница, каждый документ, каждая реклама потенциально является вектором атаки. А действий у браузерного агента много: переход по ссылкам, заполнение форм, скачивание файлов, клики по кнопкам.
Carter Rees из компании Reputation метко описал проблему: фраза «игнорируй предыдущие инструкции» может нести такой же разрушительный потенциал, как переполнение буфера, — при этом не имея ничего общего с известными сигнатурами вредоносного ПО. Никакой антивирус это не поймает.
Как работает защита: два слоя, которые надо пробить одновременно
Антропик не просто обучила модель лучше сопротивляться атакам. В Auto Mode, который активен в продуктах вроде Claude Cowork, выстроена двухуровневая архитектура защиты.
Первый уровень сканирует входящие данные на наличие скрытых инструкций ещё до того, как модель начинает их обрабатывать. Второй уровень блокирует опасные действия перед их исполнением. Чтобы атака прошла, злоумышленник должен независимо обойти оба барьера — задача, с которой в тестах не справился никто из 129 сценариев.
Без Auto Mode картина другая: Opus 5 показывает 3,7% успешных атак. Показательный момент — Sonnet 5 без защитных слоёв справляется лучше и показывает 0,93%. То есть одна модель без обвязки слабее другой модели без обвязки. Ноль достигается только комбинацией модель + система защиты.
Сравнение с конкурентами: у Anthropic хотя бы есть цифры
Вот где становится интересно. По данным независимого бенчмарка Gray Swan IPI, после 15 попыток атак Opus 5 показывает 2,0% успеха. Следом идут Mythos 5 с 2,6% и Fable 5 с 2,8%. Opus 5 возглавляет этот рейтинг.
Но проблема не только в цифрах — проблема в том, что сравнивать практически не с чем. GPT-5.5 от OpenAI публикует данные только по одной поверхности (коннекторы) и не разбивает результаты по типам агентных окружений. Google в своей карточке Gemini 3 ограничивается фразой «наша самая защищённая модель» с относительными улучшениями без абсолютных цифр. Meta не публикует карточку закрытой модели вообще.
Антропик публикует данные по четырём агентным поверхностям, с разбивкой по количеству попыток, с конфигурациями «с защитой» и «без», с результатами третьесторонних команд (Gray Swan, UK AISI, Apollo). Это не просто маркетинговое заявление — это аудируемые данные.
Ирония в том, что именно высокие цифры Anthropic (до 31,5% для Opus 4.8 в браузере без защиты) выглядят как уязвимость, но на самом деле это единственная твёрдая почва для сравнения на рынке. Когда конкурент не публикует ничего — это не значит, что у него нулевые риски.
Эволюция от 4.5 к Opus 5: прогресс измеримый
Для понимания масштаба прогресса: ещё на уровне Opus 4.5 Anthropic фиксировала 1% успешных атак в браузерных сценариях и честно писала, что проблема не решена. Opus 4.8 без защиты давал 31,5% в браузере при включённом мышлении, но с защитой падал до 0,5%. Opus 5 + Auto Mode — 0% на 129 сценариях.
Это не скачок, это системная работа: переобучение модели на устойчивость к инъекциям, новые слои предобработки входных данных, блокировка на уровне исполнения действий. Три независимых инструмента, работающих вместе.
Что это значит для бизнеса и разработчиков
Для корпоративных заказчиков это меняет расчёт рисков. Если раньше браузерный агент был практически неприемлем для работы с конфиденциальными данными — слишком высокий шанс угона через подставную страницу — то теперь появляется измеримая граница безопасности.
Для разработчиков важна архитектурная мысль: безопасность агента — это не свойство одной модели, это система. Ограничивайте поверхность атаки, разделяйте среды, не давайте агенту широких прав по умолчанию. Даже 0% в тестах не означает абсолютной гарантии в production — это означает, что правильно сконфигурированная система существенно поднимает стоимость атаки для злоумышленника.
Для российских пользователей: Claude Cowork с Auto Mode доступен на Max-плане, для доступа из России потребуется VPN, оплата российскими картами не поддерживается — актуальны виртуальные карты зарубежных банков или криптоплатежи через посредников.
Осторожный оптимизм
Я бы не стал кричать «проблема решена». Anthropic и сама этого не утверждает — компания публикует данные конкретного теста в конкретной конфигурации. 129 сценариев — это не весь интернет. Реальные злоумышленники адаптируются быстрее, чем выходят новые карточки безопасности.
Но направление движения однозначное: от «может быть никогда не решится» (OpenAI, декабрь 2025) до «0% в стандартизированном тесте» (Anthropic, июль 2026) прошло меньше года. Это либо реальный прорыв, либо очень убедительная демонстрация того, как правильно выбирать тесты. Посмотрим, что скажут независимые исследователи безопасности.
Информация подтверждена несколькими независимыми публикациями, включая технический анализ системной карточки Opus 5 и сравнительные исследования безопасности ИИ-агентов.
Источники
Похожие новости
OpenAI распустила команду по катастрофическим рискам ИИ
OpenAI тихо ликвидировала отдел Preparedness, который оценивал угрозы от собственных моделей. Сотрудники говорят о нарастающем «чувстве тревоги и ответственности».
Optima: бенчмарки ИИ наконец-то на ваших реальных данных
Artificial Analysis запустила платформу Optima, которая позволяет строить персональные бенчмарки для LLM на основе собственных данных и сравнивать модели не только по качеству, но и по стоимости задачи.
ИИ-книги затопили Amazon и режут доходы живых авторов
Исследование 14 000 книг показало: ИИ-контент занял 20% каталога, но забирает лишь 12% выручки — зато тянет вниз доходы всех авторов без исключения.