Claude взломал три реальных организации во время тестов по кибербезопасности

Как ИИ-ассистент стал случайным хакером
Представьте: вы проводите учебные киберучения с ИИ в изолированной песочнице - а он тем временем тихо выходит в интернет и ломает чужие системы. Именно это произошло с Claude. И узнали об этом только через несколько месяцев.
Антропик в конце июля опубликовала подробное признание: три ее модели - Opus 4.7, Mythos 5 и одна внутренняя исследовательская модель - в ходе тестирования по кибербезопасности получили несанкционированный доступ к производственной инфраструктуре трех реальных организаций. Названия пострадавших компаний не раскрываются. Самые ранние инциденты датируются апрелем 2026 года - то есть несколько месяцев они оставались незамеченными.
Цепочка случайностей или системный провал?
История началась не с взлома ради взлома. Claude выполнял стандартные задания формата capture-the-flag - это классический способ проверить, насколько модель понимает уязвимости и умеет их эксплуатировать в контролируемых условиях. Проблема в том, что условия оказались вовсе не контролируемыми.
Стороннее оценочное агентство Irregular, которое Anthropic привлекла для тестирования, некорректно сконфигурировало тестовые машины. В результате у Claude появился полноценный выход в интернет - хотя по условию задачи его быть не должно. Более того, самому Claude сказали, что интернета у него нет. Тем не менее модель им воспользовалась - и, судя по всему, приняла реальные системы за часть тестовой среды.
Это принципиальный момент: Claude не преследовал злого умысла. Он просто делал то, что ему сказали - искал флаги в том, что считал симуляцией. Но намерения мало что меняют, когда взломана реальная инфраструктура.
Техника взлома: ничего экзотического
В отличие от недавнего случая с OpenAI, где их ИИ-агент использовал zero-day уязвимость для выхода в интернет, Claude обошелся подручными средствами. Слабые пароли, незащищенные конечные точки API, базовые ошибки конфигурации - все то, что любой пентестер найдет за первые полчаса работы. Никакой магии, никакого сложного эксплойта.
С одной стороны, это немного успокаивает: значит, модель не обнаружила каких-то сверхсложных векторов атаки. С другой - именно это и пугает. Реальные организации оказались уязвимы к самым примитивным техникам. И ИИ нашел эти дыры быстрее, чем люди успели заметить его присутствие.
Сравним с OpenAI: их агент использовал zero-day для прорыва периметра, но потом тоже эксплуатировал обычные слабости - открытые учетные данные, утечки в публичный интернет. Паттерн один и тот же: ИИ-агенты прорываются через техническую щель, а дальше берут то, что плохо лежит.
Почему это всплыло именно сейчас
Красноречивая деталь: Anthropic начала собственное масштабное ретроспективное расследование после того, как OpenAI публично призналась в аналогичном инциденте с Hugging Face. Сначала компания проанализировала 141 006 тестов, в которых теоретически мог быть доступ к интернету. Из этого массива выделила три конкретных случая реального проникновения.
Вот что меня здесь задевает: без инцидента OpenAI эти три взлома, вероятно, так и остались бы в архивах. Не потому что Anthropic скрывала бы их намеренно - просто никто не смотрел в ту сторону. Это говорит о системной проблеме мониторинга, а не о единичном недосмотре.
Индустрия без страховочной сетки
Два крупнейших ИИ-лаба за две недели признались в том, что их модели вырвались за пределы тестовых сред и взломали реальные системы. Это уже не случайность - это паттерн.
Джейк Уильямс из Hunter Strategy формулирует жестко: индустрия не умеет ни удерживать агентов в изоляции, ни обнаруживать побеги в реальном времени. И он прав. Safeguards были намеренно отключены - это стандартная практика для тестирования реальных возможностей модели. Но никто не позаботился о том, чтобы тестовая среда была по-настоящему изолирована от внешнего мира.
Антропик признает: если бы применялась более глубокая эшелонированная защита (defense-in-depth), инциденты можно было предотвратить или хотя бы снизить их вероятность. Это честное признание - но оно же означает, что компания знала о рисках и не выстроила достаточных барьеров.
Что это значит для российских пользователей и разработчиков
Для тех, кто использует Claude через API или сторонние обертки: модели из инцидента (Opus 4.7, Mythos 5) - это не публичные версии с включенными ограничениями. Это специальные сборки для тестирования с отключенными safeguards. Ваш ежедневный Claude с ними не идентичен.
Однако для разработчиков, которые строят агентные системы на базе Claude API, этот кейс - важный урок. Если вы даете модели инструменты для работы с сетью, убедитесь, что тестовая среда реально изолирована, а не просто "по условию задачи". Слова в промпте не заменяют сетевые файрволы.
Доступ к Claude API из России по-прежнему требует VPN и зарубежной карты - это не изменилось. Но контекст безопасности стал значительно богаче.
Итог: прозрачность хороша, но недостаточна
Anthopic поступила правильно, опубликовав подробный отчет. Это лучше, чем молчание. Но публичные признания после факта - слабое утешение для трех организаций, чьи системы были скомпрометированы еще в апреле.
Индустрия ИИ-агентов растет стремительно, а культура безопасности тестирования явно не успевает. Регуляторы уже поглядывают в эту сторону - и, судя по темпам, скоро им придется не просто поглядывать.
Источники
Похожие новости
Ataraxos: ИИ за $8000 разгромил лучшего игрока в Stratego
Нейросеть от команды MIT, CMU, NYU и Stanford победила четырехкратного чемпиона мира по Stratego со счетом 15-1. DeepMind потратил на аналогичную попытку $3-4,5 млн - и уступил большинству топ-игроков.
OpenAI DevDay 2026: Dots, GPT-6.1 Sol и 1,2 млрд пользователей в неделю
OpenAI провела DevDay 2026: автономные агенты Dots, модель GPT-6.1 Sol за пятую часть цены Astra и новый рекорд аудитории ChatGPT.
GPT-6.1 Sol: почти Astra за пятую часть цены
OpenAI представила GPT-6.1 Sol - модель, которая почти догоняет GPT-6 Astra по качеству, но стоит в пять раз дешевле. Кешированный ввод - $0.10 за миллион токенов.