Nvidia SoL-Pi режет расходы на токены кодящих агентов почти вдвое

Когда ИИ-агент начинает писать код самостоятельно, счетчик токенов крутится как таксометр в час пик. Каждый шаг - планирование, вызов инструмента, обработка ошибки, повторная проверка - наматывает новые слои контекста поверх предыдущих. Через несколько десятков итераций агент тащит за собой хвост из тысяч токенов, большинство из которых давно утратили смысл. Nvidia решила атаковать эту проблему не там, где все обычно ищут, - не в весах модели и не в квантизации, а в так называемом harness - управляющем слое между моделью и средой исполнения.
Что такое harness и почему его никто не трогал
Системы вроде Codex, Claude Code или OpenClaw используют harness для координации: он определяет, как агент видит текущее состояние, как запускает действия и как получает обратную связь. Это тот самый невидимый диспетчер, который решает, что показать модели, а что выбросить. Проблема в том, что harness - это клубок взаимосвязей: инструменты, управление контекстом, логика верификации и прерывания намертво переплетены. Тронешь одно - сломается в трех других местах. Именно поэтому люди оптимизировали harness вручную, долго и мучительно просматривая логи выполнения.
SoL-Pi автоматизирует эту работу. Исследовательский агент наблюдает за трассами работающего агента, предлагает изменения и проверяет их в подготовленных средах. Выживают только те кандидаты, которые сохраняют производительность и одновременно режут расход токенов.
3000 прогонов ради четырех механизмов
Масштаб поиска впечатляет чисто числами: 535 исполняемых сред, 152 направления исследования, более 3000 прогонов и свыше 60 000 взаимодействий агента со средой. Задачи брались из реальных GitHub-пар "issue - pull request" (495 штук) плюс 40 синтетических тест-кейсов. Авторы честно признают: больший масштаб поиска не гарантирует лучших результатов. Это важная оговорка, потому что у автоматически оптимизированных harness-систем давно известна болезнь - переобучение на обучающих задачах при провале на незнакомых.
Чтобы не наступить на те же грабли, команда жестко отделила поиск от оценки. Бенчмарк EdgeBench был полностью заморожен на этапе обучения: из 51 публичной задачи 11 использовались один раз для валидации готовых кандидатов, оставшиеся 40 - только для финальной оценки, и их результаты никогда не попадали обратно в поисковый процесс.
Четыре конкретных механизма, которые дают эффект
По итогам всего этого поиска система нашла ровно четыре рабочих механизма.
Action Fusion объединяет два последовательных шага в один - например, редактирование кода и запуск тестов. Устраняется целый вызов языковой модели.
Online Context Compact запускается после каждого шага планирования и обрезает накопившийся контекст там, где это не грозит потерей информации. Это не агрессивное сжатие, а точечная чистка.
ObservationPack архивирует длинные выводы инструментов и при последующих шагах подставляет короткое резюме вместо полного текста. Агент перестает раз за разом "перечитывать" одни и те же портянки логов.
Evidence-Preserving Reducer перенаправляет большие журналы ошибок и тестов на более дешевую модель, которая выжимает из них ключевые выводы. Автоматическая проверка ловит случаи, когда дешевая модель упустила что-то критическое.
Цифры на EdgeBench
На практике SoL-Pi дает -50% токенов по сравнению с Codex и -54,3% по сравнению с Claude Code на EdgeBench. Общая экономия по метрике расхода токенов достигает 49% при минимальном изменении качества решений. Это не теоретический прирост - EdgeBench измерял реальные задачи программирования, изолированные от обучения.
Для сравнения: большинство методов сжатия на уровне модели (квантизация, прунинг) снижают стоимость токена, но часто ценой заметного падения точности. Здесь падение качества авторы описывают как "примерно нулевое" - хотя конкретные числа по качеству в публичном описании скромнее, чем хотелось бы.
Что это меняет на практике
Для команд, которые гоняют кодящих агентов в продакшне, экономия токенов - это прямая строка в бюджете. Если агент делает 100 прогонов в день, а каждый прогон стоил условно 10 000 токенов, то после SoL-Pi это примерно 5 000. Умножьте на цену токена у любого провайдера - и получите ощутимую сумму уже на масштабах среднего стартапа.
Технически интереснее другое: подход SoL-Pi переносит акцент оптимизации с уровня модели на уровень оркестрации. Авторы подтвердили переносимость найденного harness между конфигурациями GPT-5.6 Sol и Opus 5, однако насколько оптимизации работают с другими моделями - в публичном описании не раскрывается.
Отдельный вопрос - переносимость на незнакомые задачи. Авторы специально боролись с переобучением через изоляцию бенчмарка, но насколько найденные четыре механизма работают на задачах за пределами GitHub-репозиториев - пока неизвестно. Реальная проверка начнется, когда кто-то из сообщества попробует применить SoL-Pi на своих корпоративных кодовых базах.
Для российских разработчиков доступность зависит от того, через какой API они работают. Если через Azure OpenAI или локальную модель - никаких дополнительных ограничений нет. Если через прямой API OpenAI или Anthropic - стандартные вопросы с платежными инструментами остаются актуальными.
Nvidia публикует это как исследовательскую работу, а не как готовый продукт. Код доступен в открытом репозитории NVlabs/SoL-Pi. Направление обозначено четко: следующий фронт оптимизации агентов лежит не внутри модели, а в том, как агент управляет своим собственным вниманием к окружающей среде.
Источники
Похожие новости
OpenAI и Synopsys учат ИИ проектировать чипы вместе с инженерами
OpenAI и Synopsys запустили многолетнее партнерство и строят GPT-Synopsys - специализированную модель, которая умеет работать с EDA-инструментами и помогает инженерам оптимизировать дизайн полупроводников.
H Company выпустила Holo4: агент для компьютера за $0.08 за задачу
H Company открыла веса Holo4 - двух моделей для управления компьютером, которые набирают 85.2% на OSWorld и обходят GPT-5.5 по соотношению цены и результата.
Microsoft Copilot получил агента Autopilot и оплату по факту использования
Microsoft разделила Copilot на три раздела и запустила автономного агента Autopilot на базе OpenClaw - теперь он работает в облаке без участия пользователя.