Cursor: дешевые модели справятся с кодом, если умные спланируют работу

Рой агентов против одного гения
Что если самая дорогая часть ИИ-разработки - это не написание кода, а умение правильно поставить задачу? Именно этот вопрос Cursor, судя по всему, и решал последние месяцы. Результаты их экспериментов с роем агентов меняют представление о том, как вообще должна работать автоматизация программирования.
Команда Cursor взяла провокационный бенчмарк: реализовать SQLite на Rust с нуля, имея только 835-страничную документацию. Никакого исходного кода, никакого интернета, никаких подсказок о существовании тестового набора sqllogictest с миллионами SQL-запросов. Старый рой агентов и новый запустили на одинаковых моделях с одинаковым временным бюджетом. Победитель был очевиден уже через два часа.
Планировщики и исполнители: разделение труда по Коузу
Архитектура новой системы элегантна в своей простоте. Плановые агенты на базе мощных фронтирных моделей рекурсивно разбивают цель на подзадачи - и больше ничего не делают. Рабочие агенты на базе быстрых и дешевых моделей исполняют эти подзадачи - и никогда не планируют.
Cursor даже апеллирует к экономисту Рональду Коузу, который объяснял существование фирм тем, что координационные издержки растут быстрее самой работы. Организации естественным образом делятся на уровни с ограниченными зонами ответственности. Рой агентов - та же самая структура, только в коде.
Ключевой инсайт: проблема одиночного агента в длинных задачах - не вычислительная, а контекстная. Агент, который держит в голове одновременно общую цель и текущую микрозадачу, неизбежно дрейфует. Планировщик в новой системе никогда не видит низкоуровневых деталей. Рабочий никогда не отвлекается на стратегию. Это и есть источник эффективности - не параллелизм как таковой.
Тысяча коммитов в секунду убила Git
Старый рой браузера выдавал около 1000 коммитов в час - и Git с этим справлялся. Новый рой вышел на 1000 коммитов в секунду. Git сломался. Cursor написал собственную систему контроля версий.
Но проблема была не только в скорости. Возникли паттерны сбоев, которых человеческие команды никогда не видели. Два планировщика независимо разрабатывали одну и ту же идею в разных частях кодовой базы - "split-brain design". Когда планировщики знали друг о друге, они блокировали друг друга конкурирующими правками. Cursor решил это через общие проектные документы с компилируемыми ссылками: каждый фрагмент кода, связанный с решением, ссылался на документ, и компилятор проверял эту связь. Конфликты слияния разрешал нейтральный агент-медиатор. Раздувшиеся файлы автоматически разбивались на модули.
Отдельно интересно решение с "полевым руководством" (Field Guide) - папкой знаний, которую агенты ведут сами для себя с фиксированным лимитом строк. Каждый новый агент получает ее содержимое при запуске. Поскольку веса моделей заморожены, единственный способ передать накопленный опыт следующим агентам - записать его явно.
Цифры, которые меняют экономику ИИ-разработки
Тестировались четыре конфигурации: GPT-5.5 соло, Grok 4.5 соло, Opus 4.8 как планировщик с Composer 2.5 как исполнителем, и Fable 5 как планировщик с Composer 2.5 как исполнителем.
Через четыре часа новые конфигурации показали 73-85% на тестовом наборе. Старый рой к тому же времени - значительно меньше, причем Grok 4.5 в старой системе пришлось остановить уже на втором часу из-за лавины конфликтов. В итоге все четыре конфигурации новой системы достигли 100% на полном тестовом наборе.
Но самое важное - не качество, а стоимость. Гибридный запуск с Opus 4.8 в роли планировщика и Composer 2.5 в роли исполнителя обошелся существенно дешевле, чем запуск с GPT-5.5 на всех ролях - при сопоставимом результате. Токены планировщика стоят непропорционально дорого, но их нужно значительно меньше. Большинство токенов потребляют рабочие агенты, и здесь дешевые модели справляются не хуже.
Что это значит для индустрии
Cursor - это уже не просто редактор кода. Anysphere, компания за ним, была приобретена SpaceX Илона Маска за $60 миллиардов. На таком фундаменте эксперименты с роями агентов - это не академические упражнения, а прямая инвестиция в следующее поколение инструментов разработки.
Для сравнения: GitHub Copilot, Claude Code и OpenAI Codex все движутся в сторону агентных рабочих процессов, но ни один из них публично не представил сопоставимых данных по масштабированию роев. Cursor здесь явно впереди по глубине инженерной проработки - по крайней мере, в части публичных отчетов.
Для разработчиков практический вывод такой: архитектура "планировщик + исполнитель" - это не просто оптимизация затрат. Это принципиально другой способ думать о сложных задачах автоматизации. Если ваш агент дрейфует на длинных задачах - скорее всего, проблема в контексте, а не в модели.
Для бизнеса цифры говорят сами за себя: если 90% токенов можно заменить дешевыми моделями без потери качества, экономика ИИ-ассистированной разработки меняется радикально. Это уже работающая система.
Информация о результатах экспериментов подтверждена несколькими независимыми публикациями, анализировавшими технический отчет Cursor.
Похожие новости
OpenAI и Synopsys учат ИИ проектировать чипы вместе с инженерами
OpenAI и Synopsys запустили многолетнее партнерство и строят GPT-Synopsys - специализированную модель, которая умеет работать с EDA-инструментами и помогает инженерам оптимизировать дизайн полупроводников.
H Company выпустила Holo4: агент для компьютера за $0.08 за задачу
H Company открыла веса Holo4 - двух моделей для управления компьютером, которые набирают 85.2% на OSWorld и обходят GPT-5.5 по соотношению цены и результата.
Nvidia SoL-Pi режет расходы на токены кодящих агентов почти вдвое
Исследователи Nvidia научили систему SoL-Pi автоматически оптимизировать управляющий слой агентов - и получили минус 49% токенов без потери качества.