Microsoft Webwright: терминал вместо браузера - GPT-5.4 достигает 60,1% на Odysseys

Когда "кликать" - уже не вариант
Представьте разработчика, которого заставляют каждый раз вручную кликать по интерфейсу вместо того, чтобы написать скрипт. Именно так работает большинство современных веб-агентов - они получают скриншот или DOM-дерево страницы и предсказывают следующее примитивное действие: клик, скролл, ввод текста. Microsoft Research решила, что это архаика, и выпустила Webwright - фреймворк, который переосмысливает саму модель взаимодействия агента с браузером.
Идея радикально простая: дать агенту терминал, а не браузерную сессию. Пусть пишет код.
Что такое Webwright и почему это не очередной фреймворк
Webwright - это открытый фреймворк от лаборатории AI Frontiers в Microsoft Research, созданный командой из четырех исследователей (двое из Microsoft, двое из Университета Гонконга). Вся система умещается примерно в 1000-1500 строк кода и состоит из трех модулей: Runner (~150 строк), Model Endpoint (~550 строк) и terminal Environment (~300 строк). Никаких многоагентных оркестровок, граф-движков, скрытых слоев абстракции - только один агентный цикл.
Агент получает терминал и пишет Playwright-скрипты для управления браузером. Playwright - тоже продукт Microsoft, библиотека для программного управления Chromium, Firefox и WebKit. Разница с классическим подходом принципиальная: браузерная сессия здесь не является постоянным рабочим пространством. Агент запускает браузер, инспектирует страницу, пишет скрипт, перезапускает - и так итеративно, как настоящий инженер, разрабатывающий RPA-автоматизацию.
Постоянный артефакт - не сессия браузера, а код и логи в локальном воркспейсе. Это меняет все: скрипт можно переиспользовать, адаптировать, передать коллеге. Вместо того чтобы каждый раз заново "открывать" сайт, агент один раз создает программу.
Как решаются главные инженерные проблемы
Разработчики честно признают два ключевых вызова, с которыми столкнулись.
Первый - преждевременное завершение (premature 'done'). Модель склонна объявлять задачу выполненной, не закончив ее на самом деле. Решение элегантное: агент обязан сгенерировать конфиг самопроверки, запустить финальный скрипт в чистой папке и пройти собственный "суд" - только после этого флаг `done: true` засчитывается.
Второй - взрыв контекста. Длинные траектории кода быстро переполняют контекстное окно. Решение: каждые 20 шагов история компактируется в одно резюме. Просто и работает.
Цифры, которые говорят сами за себя
Webwright тестировали на двух бенчмарках.
На Odysseys - бенчмарке для сложных долгосрочных веб-задач - GPT-5.4 в связке с Webwright достигает 60,1% против базовых 33,5% той же модели без фреймворка. Прирост почти вдвое - это не косметика, это смена парадигмы.
На Online-Mind2Web (300 задач по 136 популярным сайтам) результаты еще более впечатляющие: GPT-5.4 показывает 86,67% - лучший результат среди всех опенсорсных решений в категории AutoEval при бюджете в 100 шагов. Claude Opus 4.7 достигает 84,7% в общем зачете, но обходит GPT-5.4 на сложных задачах при N=100: 80,5% против 76,6%.
Отдельный факт: авторы также тестировали Qwen3.5-9B с инструментами Webwright на разделе Online-Mind2Web, однако конкретные цифры по этой модели в доступных материалах не приводятся.
Почему это важно для разработчиков и бизнеса
Классические веб-агенты хрупки: стоит сайту чуть изменить верстку - и агент теряется. Webwright обходит эту проблему через структурный доступ к DOM, ожидание условий и обработку динамического поведения (lazy loading, ре-рендеринг). Скрипты не зависят от пиксельных координат.
Для бизнеса это означает возможность один раз написать автоматизацию и переиспользовать ее. Скрипт, созданный Webwright, можно запускать через CLI с аргументами - это уже полноценный RPA-инструмент, только созданный не программистом вручную, а агентом.
Task2UI mode, добавленный 11 мая 2026 года, позволяет агенту не просто выполнить задачу, но и отрендерить результаты в HTML-приложение для просмотра и переиспользования.
Мой взгляд: смена парадигмы или еще один инструмент?
Webwright - один из тех проектов, которые выглядят очевидными задним числом. "Дать агенту терминал" звучит банально, но подход дает измеримый прирост на обоих бенчмарках.
Действие-за-действием - распространенная схема среди веб-агентов, и Webwright ломает ее принципиально: агент пишет программу, а не предсказывает следующий клик. Результаты говорят о том, что модели готовы к такому уровню свободы - им просто не давали инструментов.
Webwright - опенсорс на GitHub. Для работы нужны API-ключи совместимых LLM-провайдеров. Конкретный список поддерживаемых провайдеров и возможные региональные ограничения лучше уточнять напрямую в репозитории проекта.
Похожие новости
DeepSeek Harness v0.2: десктоп, плагины и планировщик задач без командной строки
DeepSeek выпустил v0.2 своего агентного фреймворка с нативными приложениями для macOS и Windows, встроенным менеджером плагинов и планировщиком задач на базе session-local механизма.
OpenAI и Synopsys учат ИИ проектировать чипы вместе с инженерами
OpenAI и Synopsys запустили многолетнее партнерство и строят GPT-Synopsys - специализированную модель, которая умеет работать с EDA-инструментами и помогает инженерам оптимизировать дизайн полупроводников.
H Company выпустила Holo4: агент для компьютера за $0.08 за задачу
H Company открыла веса Holo4 - двух моделей для управления компьютером, которые набирают 85.2% на OSWorld и обходят GPT-5.5 по соотношению цены и результата.