Команды ИИ-агентов стоят в 5 раз дороже, а результат почти тот же

Мультиагентная архитектура - один из главных трендов 2026 года в ИИ-разработке. OpenAI и Anthropic встроили нативную оркестрацию агентов прямо в свои платформы, маркетинг обещает кратный рост производительности, а стартапы наперебой строят "роевые" системы из десятков субагентов. На этом фоне исследование компании Vals AI выглядит как холодный душ: команды агентов обходятся дороже в 1,8-5,1 раза, а реальный прирост качества - почти нулевой.
Что и как тестировали
Vals AI прогнала GPT-6 Sol и Claude Opus 5.5 через собственный бенчмарк Vibe Code Bench. Задача - собрать полноценное веб-приложение по продуктовой спецификации и задеплоить его через Docker Compose. Браузерные агенты затем проверяли работу готового приложения: базу данных, API, интерфейс, права доступа, конфигурацию деплоя. Каждая модель прошла по 50 спецификаций в каждой конфигурации - соло и в команде, на среднем и максимальном уровне рассуждений.
Команда получала ведущего агента с правом запускать до пяти субагентов параллельно. Ему давали короткую инструкцию: раздели задачу, делегируй, проверь результат. GPT-6 Sol делегировал архитектурно и параллельно; Opus 5.5 писал файл CONTRACT.md и рассылал последовательные волны строителей и тестировщиков.
Цифры, от которых неловко
Из четырех сравнений "соло против команды" статистически значимый результат дал только один: Sol на среднем уровне рассуждений. Команда набрала 84,9% против 77,6% у одиночного агента - прирост 7,3 процентных пункта при p = 0,005. Цена вопроса - $3,07 за приложение против $1,22 у соло-агента, то есть в 2,5 раза дороже.
Остальные три конфигурации не дали ничего значимого. Диапазон - от -0,3 до +3,4 пункта, и это в рамках случайного разброса.
Самый впечатляющий провал - Opus 5.5 на максимальном уровне рассуждений в команде. Он набрал 93,2% - лучший результат в тесте. Но стоит это $122 за приложение и занимает 174 минуты. Соло-агент Opus на среднем уровне выдал 91,5% за $4,08 и 20 минут. Разница примерно в 1,6 процентных пункта - статистически незначимая. Среди протестированных конфигураций Opus самая дешевая показала примерно тот же результат, что и самая дорогая.
Еще один показательный факт: для Sol повышение уровня рассуждений оказалось эффективнее, чем добавление команды. Переход с medium на maximum в соло-режиме дал +11,4 пункта (с 77,6% до 89,0%). Команда на medium дала только +7,3. То есть перед тем как строить оркестр, стоит просто докрутить мощность одного агента.
Почему дорого: "налог на координацию"
Значительная часть дополнительных расходов приходится на кешированные входные токены: каждый субагент получает собственную копию спецификации и рабочего контекста. Они дешевле обычных токенов, но при масштабировании накапливаются быстро.
Девелопер OpenAI Эрик Провенчер назвал это "налогом на координацию": агенты начинают мешать друг другу, согласование съедает выигрыш от параллельности. Он прямо предупредил против "роевых" систем, назвав их скорее выброшенными деньгами.
Данные Anthropic по их собственным тестам с Opus 5.5 подтверждают ту же картину: переход от 10 к 100 агентам чуть сдвигает качество, но не кардинально. На задаче с базой знаний 10 агентов дали 0,70, 30 агентов - 0,71, 100 агентов - 0,74. Каждое удесятерение команды дает все меньше.
Скорость - да, качество - нет
Исследователь OpenAI Ноам Браун в подкасте Дваркеша прямо сказал: мультиагентные системы покупают скорость, а не качество. Четыре агента решают задачу вдвое быстрее, но и стоят вдвое дороже. При 16 агентах паттерн сохраняется, но эффективность немного падает.
При этом параллелизация работает далеко не везде. Веб-поиск и математика хорошо делятся на части; написание романа - нет. Браун сформулировал жестко: 10 000 агентов на написание романа так же бессмысленны, как 10 000 человек на ту же задачу.
В таблице Vals AI это видно по времени: Sol в команде на medium действительно быстрее - 11,9 минуты против 12,4. Но Opus в команде работает медленнее своего соло-варианта: 26,6 минуты против 20,3. Архитектура последовательных волн Opus просто не параллелится так же хорошо.
Что это значит на практике
Для разработчиков вывод простой: прежде чем строить мультиагентную систему, проверьте, не решается ли задача повышением уровня рассуждений одного агента. В случае Sol это дало больший прирост при меньших затратах.
Для бизнеса: если задача хорошо параллелится (например, параллельная проверка множества независимых компонентов), команда агентов может дать выигрыш во времени при приемлемой переплате. Если задача последовательная или интеграционная - команда скорее навредит, чем поможет.
Для разработчиков, работающих с этими моделями через API: цифры Vals AI особенно актуальны, потому что стоимость токенов при мультиагентном прогоне растет непропорционально. Opus 5.5 в команде на максимуме - $122 за одно приложение - это уже серьезная статья бюджета даже для небольшого проекта.
Главный вывод из всего этого: мультиагентность пока продает ощущение масштаба лучше, чем реальный результат. Индустрия обнаружила, что больше агентов - это в первую очередь больше токенов, а не лучший код. Это не значит, что направление тупиковое - но текущие реализации явно не оправдывают маркетинговых ожиданий.
Источники
Похожие новости
Claude управляет 1000 агентами сразу: в 2,4 раза больше найденных багов
Anthropic добавила в Claude Managed Agents динамические воркфлоу: один ведущий агент раздает задачи до 1000 подагентов параллельно и собирает результаты. На тесте с 70 спрятанными багами одиночный агент нашел максимум 27, а рой - стабильно 66.
Anthropic запустил бесплатный ИИ-сканер уязвимостей для опенсорса
Anthropic открыл OSS Scanner - бесплатный сервис поиска уязвимостей в открытом коде на базе Claude Mythos. За полгода модели уже нашли больше 29 000 потенциальных проблем.
Один промпт взломал все ИИ-агенты в AWS-аккаунте
Исследователи Zenity Labs обнаружили цепочку уязвимостей в Amazon Bedrock AgentCore: одно сообщение в чате публичному агенту открывало доступ ко всем агентам аккаунта.