V
Генерация кодаVals AIмультиагентностьGPT-6 SolClaude Opus 5.5AI-агенты

Команды ИИ-агентов стоят в 5 раз дороже, а результат почти тот же

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
Команды ИИ-агентов стоят в 5 раз дороже, а результат почти тот же

Мультиагентная архитектура - один из главных трендов 2026 года в ИИ-разработке. OpenAI и Anthropic встроили нативную оркестрацию агентов прямо в свои платформы, маркетинг обещает кратный рост производительности, а стартапы наперебой строят "роевые" системы из десятков субагентов. На этом фоне исследование компании Vals AI выглядит как холодный душ: команды агентов обходятся дороже в 1,8-5,1 раза, а реальный прирост качества - почти нулевой.

Что и как тестировали

Vals AI прогнала GPT-6 Sol и Claude Opus 5.5 через собственный бенчмарк Vibe Code Bench. Задача - собрать полноценное веб-приложение по продуктовой спецификации и задеплоить его через Docker Compose. Браузерные агенты затем проверяли работу готового приложения: базу данных, API, интерфейс, права доступа, конфигурацию деплоя. Каждая модель прошла по 50 спецификаций в каждой конфигурации - соло и в команде, на среднем и максимальном уровне рассуждений.

Команда получала ведущего агента с правом запускать до пяти субагентов параллельно. Ему давали короткую инструкцию: раздели задачу, делегируй, проверь результат. GPT-6 Sol делегировал архитектурно и параллельно; Opus 5.5 писал файл CONTRACT.md и рассылал последовательные волны строителей и тестировщиков.

Цифры, от которых неловко

Из четырех сравнений "соло против команды" статистически значимый результат дал только один: Sol на среднем уровне рассуждений. Команда набрала 84,9% против 77,6% у одиночного агента - прирост 7,3 процентных пункта при p = 0,005. Цена вопроса - $3,07 за приложение против $1,22 у соло-агента, то есть в 2,5 раза дороже.

Остальные три конфигурации не дали ничего значимого. Диапазон - от -0,3 до +3,4 пункта, и это в рамках случайного разброса.

Самый впечатляющий провал - Opus 5.5 на максимальном уровне рассуждений в команде. Он набрал 93,2% - лучший результат в тесте. Но стоит это $122 за приложение и занимает 174 минуты. Соло-агент Opus на среднем уровне выдал 91,5% за $4,08 и 20 минут. Разница примерно в 1,6 процентных пункта - статистически незначимая. Среди протестированных конфигураций Opus самая дешевая показала примерно тот же результат, что и самая дорогая.

Еще один показательный факт: для Sol повышение уровня рассуждений оказалось эффективнее, чем добавление команды. Переход с medium на maximum в соло-режиме дал +11,4 пункта (с 77,6% до 89,0%). Команда на medium дала только +7,3. То есть перед тем как строить оркестр, стоит просто докрутить мощность одного агента.

Почему дорого: "налог на координацию"

Значительная часть дополнительных расходов приходится на кешированные входные токены: каждый субагент получает собственную копию спецификации и рабочего контекста. Они дешевле обычных токенов, но при масштабировании накапливаются быстро.

Девелопер OpenAI Эрик Провенчер назвал это "налогом на координацию": агенты начинают мешать друг другу, согласование съедает выигрыш от параллельности. Он прямо предупредил против "роевых" систем, назвав их скорее выброшенными деньгами.

Данные Anthropic по их собственным тестам с Opus 5.5 подтверждают ту же картину: переход от 10 к 100 агентам чуть сдвигает качество, но не кардинально. На задаче с базой знаний 10 агентов дали 0,70, 30 агентов - 0,71, 100 агентов - 0,74. Каждое удесятерение команды дает все меньше.

Скорость - да, качество - нет

Исследователь OpenAI Ноам Браун в подкасте Дваркеша прямо сказал: мультиагентные системы покупают скорость, а не качество. Четыре агента решают задачу вдвое быстрее, но и стоят вдвое дороже. При 16 агентах паттерн сохраняется, но эффективность немного падает.

При этом параллелизация работает далеко не везде. Веб-поиск и математика хорошо делятся на части; написание романа - нет. Браун сформулировал жестко: 10 000 агентов на написание романа так же бессмысленны, как 10 000 человек на ту же задачу.

В таблице Vals AI это видно по времени: Sol в команде на medium действительно быстрее - 11,9 минуты против 12,4. Но Opus в команде работает медленнее своего соло-варианта: 26,6 минуты против 20,3. Архитектура последовательных волн Opus просто не параллелится так же хорошо.

Что это значит на практике

Для разработчиков вывод простой: прежде чем строить мультиагентную систему, проверьте, не решается ли задача повышением уровня рассуждений одного агента. В случае Sol это дало больший прирост при меньших затратах.

Для бизнеса: если задача хорошо параллелится (например, параллельная проверка множества независимых компонентов), команда агентов может дать выигрыш во времени при приемлемой переплате. Если задача последовательная или интеграционная - команда скорее навредит, чем поможет.

Для разработчиков, работающих с этими моделями через API: цифры Vals AI особенно актуальны, потому что стоимость токенов при мультиагентном прогоне растет непропорционально. Opus 5.5 в команде на максимуме - $122 за одно приложение - это уже серьезная статья бюджета даже для небольшого проекта.

Главный вывод из всего этого: мультиагентность пока продает ощущение масштаба лучше, чем реальный результат. Индустрия обнаружила, что больше агентов - это в первую очередь больше токенов, а не лучший код. Это не значит, что направление тупиковое - но текущие реализации явно не оправдывают маркетинговых ожиданий.

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости