Laguna S 2.1: крошечная модель Poolside, которая бьёт гигантов

Маленький, да удалый
Есть что-то провокационное в том, как Poolside назвала свой пресс-релиз: «самая способная открытая модель Запада». Громко? Да. Но цифры за этим стоят вполне реальные — и они заслуживают внимательного разбора.
Laguna S 2.1 — это третья кодинговая модель компании за три месяца. После апрельского дебюта Laguna M.1 и XS.2 команда явно не собирается брать паузу. Новинка построена на архитектуре Mixture-of-Experts: 118 миллиардов параметров суммарно, но активируется лишь 8 миллиардов на каждый токен — примерно 6,8% от общего числа. Именно эта разреженность позволяет модели вести себя как значительно более крупная система, оставаясь дешёвой в обслуживании.
Что внутри и как это работает
Пре-тренинг стартовал 22 мая 2026 года на кластере из 4096 видеокарт NVIDIA H200 и завершился менее чем за девять недель — темп, достойный уважения. Это первая модель Poolside, где reinforcement learning проводился в точности FP8, что само по себе интересный технический выбор.
Контекстное окно — до одного миллиона токенов, модель работает в двух режимах: с мышлением (thinking) и без. Веса опубликованы на Hugging Face в форматах BF16, FP8, INT4 и NVFP4, плюс официальные конвертации GGUF и MLX. Лицензия — OpenMDW-1.1. Принципиально важный момент для практиков: модель помещается на одном NVIDIA DGX Spark — то есть её можно поднять локально без многомиллионной инфраструктуры.
Бенчмарки: где модель реально стоит
Цифры говорят сами за себя, но контекст важен. На Terminal-Bench 2.1 с включённым мышлением Laguna S 2.1 набирает 70.2% — это первое место среди открытых моделей с раскрытым размером. Позади неё остаются DeepSeek-V4-Pro-Max (1.6T-A49B, 64.0%), Nemotron 3 Ultra (550B-A55B, 56.4%) и Inkling от Thinking Machines (975B-A41B, 63.8%). Тencent Hy3 с её 295B-A21B чуть впереди — 71.7%.
Но самый красноречивый показатель — DeepSWE v1.1: Laguna S 2.1 набирает 40.4%, тогда как DeepSeek-V4-Pro-Max с примерно в шесть раз большим числом активных параметров показывает лишь 9.0%. Это не опечатка — разрыв действительно такой.
На SWE-Bench Multilingual модель выдаёт 78.5% — лучший результат в опубликованной таблице, обходя даже Qwen3.7-Max (78.3%) и DeepSeek-V4-Pro-Max (76.2%). На SWE-Bench Pro — 59.4%.
Закрытые фронтирные системы — Claude Fable 5, GPT-5.6 Sol, Kimi K3 — по-прежнему лидируют на нескольких бенчмарках. Poolside и не претендует на абсолютное первенство: речь о доминировании в своей весовой категории.
Отдельно про режим мышления: без него Terminal-Bench падает с 70.2% до 60.4%, а DeepSWE — с 40.4% до 16.5%. Это самый большой разрыв между режимами среди всех моделей Laguna. Цена — токены: в режиме thinking траектории DeepSWE занимают около 249 тысяч токенов против 99 тысяч без него.
Философия упорства вместо масштаба
Главный тезис Poolside — не «мы сделали умнее», а «мы сделали настойчивее». Предыдущие Laguna-модели порой останавливались, пройдя лишь часть тестового набора, или бросали подход за два шага до успеха. В S 2.1 это поведение целенаправленно исправлено: больше верификации, меньше преждевременных выводов о победе, готовность пересматривать неудачные подходы.
Подход подкреплён постобучением на 409 000 сред — цифра, которую Poolside раскрыла в документации к релизу.
Три демонстрации живого поведения
Poolside опубликовала три необрезанные траектории, чтобы показать поведение, а не только числа.
Первая: модель построила рабочий браузерный движок с нуля — из пустой папки за 181 шаг и 50 минут, без вмешательства человека, с валидацией вывода через headless Chromium.
Вторая: оптимизация собственного агентного фреймворка Poolside — модель сделала его на 5.2% быстрее при снижении выделения памяти на 71%, заменив O(n²)-конкатенацию строк на буферы.
Третья — самая впечатляющая: независимое доказательство задачи Эрдёша №397, открытой с 1975 года. Модель работала в песочнице без Python, писала на Perl, прошла 40 шагов, сгенерировала 283 981 символ рассуждений — и всё это стоило $0.088. GPT-5.2 Pro решил эту же задачу в январе 2026-го, но дата обучения Laguna — ноябрь 2025-го, так что это действительно независимое переоткрытие.
Что это значит для рынка — и для российских разработчиков
Poolside прямо говорит о геополитическом контексте: большинство топовых открытых моделей сегодня выходят из китайских лабораторий, тогда как западные компании уводят лучшие системы за закрытые API. Laguna S 2.1 позиционируется как ответ на этот дефицит.
Для российских разработчиков картина практическая: веса доступны на Hugging Face, доступ через VPN стандартный, модель можно запустить локально — никаких API-ключей и геоблокировок не требуется. Форматы GGUF и MLX означают совместимость с llama.cpp и Mac-железом. Единственное ограничение — сам DGX Spark стоит денег, но для команд с собственными GPU-серверами это реальный вариант.
Параллельно Poolside сообщает, что более крупная модель уже в пре-тренинге. Учитывая темп — три модели за три месяца — следующий релиз можно ожидать уже осенью.
Лично меня в этой истории больше всего привлекает методологический сдвиг: вместо гонки за параметрами — инвестиции в поведение модели при долгих агентных сессиях. Если этот подход масштабируется, мы можем увидеть принципиально другую кривую эффективности в кодинговых агентах — и это интереснее очередного рекорда на MMLU.
*Информация подтверждена несколькими независимыми публикациями.*
Источники
Похожие новости
Ollama v0.32.12: поддержка Qwen3.8 27B с оптимизацией для Apple Silicon
Ollama выкатила обновление с поддержкой Qwen3.8 27B — мощной модели для кодинга и агентных задач, особо оптимизированной для чипов Apple Silicon.
GLM-5.3: китайский ИИ объявил себя лучшей открытой моделью для кода
Zhipu AI выпустила GLM-5.3 — модель с улучшением на 50% над предшественником только за счёт пост-обучения. Уже нашла 2436 уязвимостей в реальных проектах.
Gemini 3.7 Flash: Google бьёт Claude и GPT за полцены
Google выпустила Gemini 3.7 Flash всего через три недели после предшественника — и сразу вдвое снизила цену. По бенчмаркам кодинга модель обходит Claude Sonnet 5 и GPT-5.6 Terra.