Cursor
Генерация кодаCursorAI-агентыAnysphereSQLiteагентные рои

Cursor: дешевые модели справятся с кодом, если умные спланируют работу

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
Cursor: дешевые модели справятся с кодом, если умные спланируют работу

Рой агентов против одного гения

Что если самая дорогая часть ИИ-разработки - это не написание кода, а умение правильно поставить задачу? Именно этот вопрос Cursor, судя по всему, и решал последние месяцы. Результаты их экспериментов с роем агентов меняют представление о том, как вообще должна работать автоматизация программирования.

Команда Cursor взяла провокационный бенчмарк: реализовать SQLite на Rust с нуля, имея только 835-страничную документацию. Никакого исходного кода, никакого интернета, никаких подсказок о существовании тестового набора sqllogictest с миллионами SQL-запросов. Старый рой агентов и новый запустили на одинаковых моделях с одинаковым временным бюджетом. Победитель был очевиден уже через два часа.

Планировщики и исполнители: разделение труда по Коузу

Архитектура новой системы элегантна в своей простоте. Плановые агенты на базе мощных фронтирных моделей рекурсивно разбивают цель на подзадачи - и больше ничего не делают. Рабочие агенты на базе быстрых и дешевых моделей исполняют эти подзадачи - и никогда не планируют.

Cursor даже апеллирует к экономисту Рональду Коузу, который объяснял существование фирм тем, что координационные издержки растут быстрее самой работы. Организации естественным образом делятся на уровни с ограниченными зонами ответственности. Рой агентов - та же самая структура, только в коде.

Ключевой инсайт: проблема одиночного агента в длинных задачах - не вычислительная, а контекстная. Агент, который держит в голове одновременно общую цель и текущую микрозадачу, неизбежно дрейфует. Планировщик в новой системе никогда не видит низкоуровневых деталей. Рабочий никогда не отвлекается на стратегию. Это и есть источник эффективности - не параллелизм как таковой.

Тысяча коммитов в секунду убила Git

Старый рой браузера выдавал около 1000 коммитов в час - и Git с этим справлялся. Новый рой вышел на 1000 коммитов в секунду. Git сломался. Cursor написал собственную систему контроля версий.

Но проблема была не только в скорости. Возникли паттерны сбоев, которых человеческие команды никогда не видели. Два планировщика независимо разрабатывали одну и ту же идею в разных частях кодовой базы - "split-brain design". Когда планировщики знали друг о друге, они блокировали друг друга конкурирующими правками. Cursor решил это через общие проектные документы с компилируемыми ссылками: каждый фрагмент кода, связанный с решением, ссылался на документ, и компилятор проверял эту связь. Конфликты слияния разрешал нейтральный агент-медиатор. Раздувшиеся файлы автоматически разбивались на модули.

Отдельно интересно решение с "полевым руководством" (Field Guide) - папкой знаний, которую агенты ведут сами для себя с фиксированным лимитом строк. Каждый новый агент получает ее содержимое при запуске. Поскольку веса моделей заморожены, единственный способ передать накопленный опыт следующим агентам - записать его явно.

Цифры, которые меняют экономику ИИ-разработки

Тестировались четыре конфигурации: GPT-5.5 соло, Grok 4.5 соло, Opus 4.8 как планировщик с Composer 2.5 как исполнителем, и Fable 5 как планировщик с Composer 2.5 как исполнителем.

Через четыре часа новые конфигурации показали 73-85% на тестовом наборе. Старый рой к тому же времени - значительно меньше, причем Grok 4.5 в старой системе пришлось остановить уже на втором часу из-за лавины конфликтов. В итоге все четыре конфигурации новой системы достигли 100% на полном тестовом наборе.

Но самое важное - не качество, а стоимость. Гибридный запуск с Opus 4.8 в роли планировщика и Composer 2.5 в роли исполнителя обошелся существенно дешевле, чем запуск с GPT-5.5 на всех ролях - при сопоставимом результате. Токены планировщика стоят непропорционально дорого, но их нужно значительно меньше. Большинство токенов потребляют рабочие агенты, и здесь дешевые модели справляются не хуже.

Что это значит для индустрии

Cursor - это уже не просто редактор кода. Anysphere, компания за ним, была приобретена SpaceX Илона Маска за $60 миллиардов. На таком фундаменте эксперименты с роями агентов - это не академические упражнения, а прямая инвестиция в следующее поколение инструментов разработки.

Для сравнения: GitHub Copilot, Claude Code и OpenAI Codex все движутся в сторону агентных рабочих процессов, но ни один из них публично не представил сопоставимых данных по масштабированию роев. Cursor здесь явно впереди по глубине инженерной проработки - по крайней мере, в части публичных отчетов.

Для разработчиков практический вывод такой: архитектура "планировщик + исполнитель" - это не просто оптимизация затрат. Это принципиально другой способ думать о сложных задачах автоматизации. Если ваш агент дрейфует на длинных задачах - скорее всего, проблема в контексте, а не в модели.

Для бизнеса цифры говорят сами за себя: если 90% токенов можно заменить дешевыми моделями без потери качества, экономика ИИ-ассистированной разработки меняется радикально. Это уже работающая система.

Информация о результатах экспериментов подтверждена несколькими независимыми публикациями, анализировавшими технический отчет Cursor.

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости