Claude управляет 1000 агентами сразу: в 2,4 раза больше найденных багов

Многоагентные архитектуры обсуждают уже несколько лет, но до сих пор большинство реальных реализаций выглядели скорее демонстрацией концепции, чем рабочим инструментом. Anthropic сделала конкретный шаг: динамические воркфлоу в Claude Managed Agents теперь доступны, и компания привела цифры, которые трудно проигнорировать.
Как это работает
Архитектура прямолинейна. Ведущий агент анализирует задачу, строит план и распределяет подзадачи между подагентами. Те работают параллельно, ведущий агент собирает результаты и синтезирует итог. Максимальный масштаб - до 1000 агентов одновременно в рамках одного выполнения.
Это не совсем новая инфраструктура: Claude Managed Agents существуют уже какое-то время. Новым является именно механизм динамического распределения задач - раньше разработчикам приходилось прописывать воркфлоу вручную, теперь ведущий агент сам решает, как разбить проблему.
Активировать функцию можно через тип агента "multiagent_20261001". Войти в тему можно двумя путями: через документацию Anthropic или командой "/claude-api managed-agents-onboard" прямо в Claude Code.
Тест на 116 тысячах строк кода
Anthropic провела показательный эксперимент: взяли кодовую базу в 116 000 строк и намеренно спрятали в ней 70 багов. Дальше сравнивали два режима.
Одиночный агент находил от 14 до 27 багов за один прогон - разброс существенный, воспроизводимость низкая. Динамический воркфлоу с несколькими агентами стабильно выдавал 66 из 70. Это примерно в 2,4 раза лучше верхней планки одиночного агента и принципиально другой уровень стабильности результата.
Цифры убедительные, но контекст важен: тест создан самой Anthropic, задача специфически подходит для параллелизации (поиск независимых дефектов в коде), и 4 оставшихся бага из 70 - это все равно пропущенные ошибки. Насколько эти результаты воспроизводятся на других типах задач - открытый вопрос.
Скептицизм из стана конкурентов - и почему он частично обоснован
Недавно старший инженер OpenAI публично назвал роевые архитектуры из множества агентов расточительством токенов. Позиция понятна: если каждый из 1000 агентов тратит контекстное окно на понимание задачи, накладные расходы колоссальные.
Anthropoc сама признает проблему. В официальных рекомендациях компания прямо пишет, что динамические воркфлоу могут сжигать "очень много токенов", и советует начинать с небольших задач, прежде чем масштабировать. Это честная позиция, но она же означает, что запуск 1000 агентов на сложной задаче может стоить немалых денег - и считать экономику нужно заранее.
Для задач с высокой степенью параллелизации - аудит кода, массовая обработка документов, параллельный перебор гипотез - подход, скорее всего, оправдан. Для линейных рассуждений или задач, требующих единого контекста, тысяча агентов даст больше шума, чем пользы.
Что это меняет для разработчиков
До появления динамических воркфлоу построить надежную многоагентную систему означало вручную прописывать логику оркестрации, следить за согласованностью состояния между агентами и тестировать краевые случаи. Теперь Anthropic берет часть этой работы на себя - ведущий агент сам планирует декомпозицию.
Для команд, которые уже используют Claude Code в CI/CD или code review, это естественное расширение. Запустить аудит безопасности или рефакторинг на большой кодовой базе параллельно - понятный сценарий с измеримым результатом.
Для бизнеса картина сложнее. Нужно считать стоимость токенов против стоимости человеко-часов. При нынешних ценах на API 1000 агентов на сложной задаче - это реальные деньги, и ROI зависит от того, насколько дорога ошибка, которую они могут поймать.
Масштаб как новый стандарт
Появление официального лимита в 1000 параллельных агентов - это не просто техническая деталь. Это сигнал о том, куда движется индустрия: от единственной модели с большим контекстом к распределенной системе специализированных агентов. OpenAI двигается в том же направлении со своими агентными продуктами, Google - с Gemini в связке с Project Mariner.
Разница в том, что Anthropic показывает конкретный бенчмарк с конкретными цифрами, а не просто анонсирует возможность. 66 против 27 на задаче поиска багов - это измеримо и воспроизводимо (по крайней мере в их тестовых условиях).
Что кажется показательным: компания не скрывает ограничения. Рекомендация "начинайте с малого" и признание высокого расхода токенов - признак того, что продукт выпущен для реального использования, а не для пресс-релиза.
Информация подтверждена несколькими публикациями.
Источники
Похожие новости
Anthropic запустил бесплатный ИИ-сканер уязвимостей для опенсорса
Anthropic открыл OSS Scanner - бесплатный сервис поиска уязвимостей в открытом коде на базе Claude Mythos. За полгода модели уже нашли больше 29 000 потенциальных проблем.
Один промпт взломал все ИИ-агенты в AWS-аккаунте
Исследователи Zenity Labs обнаружили цепочку уязвимостей в Amazon Bedrock AgentCore: одно сообщение в чате публичному агенту открывало доступ ко всем агентам аккаунта.
Copilot получает доступ к файлам Windows и учится действовать с разрешения пользователя
Microsoft показала "Гибридный интеллект": Copilot теперь может работать с локальными папками, переименовывать файлы и готовить письма - но действия требуют одобрения пользователя.