P
Генерация кодаPoolsideLaguna S 2.1открытые моделиагентное кодированиеMoE

Laguna S 2.1: крошечная модель Poolside, которая бьёт гигантов

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
Laguna S 2.1: крошечная модель Poolside, которая бьёт гигантов

Маленький, да удалый

Есть что-то провокационное в том, как Poolside назвала свой пресс-релиз: «самая способная открытая модель Запада». Громко? Да. Но цифры за этим стоят вполне реальные — и они заслуживают внимательного разбора.

Laguna S 2.1 — это третья кодинговая модель компании за три месяца. После апрельского дебюта Laguna M.1 и XS.2 команда явно не собирается брать паузу. Новинка построена на архитектуре Mixture-of-Experts: 118 миллиардов параметров суммарно, но активируется лишь 8 миллиардов на каждый токен — примерно 6,8% от общего числа. Именно эта разреженность позволяет модели вести себя как значительно более крупная система, оставаясь дешёвой в обслуживании.

Что внутри и как это работает

Пре-тренинг стартовал 22 мая 2026 года на кластере из 4096 видеокарт NVIDIA H200 и завершился менее чем за девять недель — темп, достойный уважения. Это первая модель Poolside, где reinforcement learning проводился в точности FP8, что само по себе интересный технический выбор.

Контекстное окно — до одного миллиона токенов, модель работает в двух режимах: с мышлением (thinking) и без. Веса опубликованы на Hugging Face в форматах BF16, FP8, INT4 и NVFP4, плюс официальные конвертации GGUF и MLX. Лицензия — OpenMDW-1.1. Принципиально важный момент для практиков: модель помещается на одном NVIDIA DGX Spark — то есть её можно поднять локально без многомиллионной инфраструктуры.

Бенчмарки: где модель реально стоит

Цифры говорят сами за себя, но контекст важен. На Terminal-Bench 2.1 с включённым мышлением Laguna S 2.1 набирает 70.2% — это первое место среди открытых моделей с раскрытым размером. Позади неё остаются DeepSeek-V4-Pro-Max (1.6T-A49B, 64.0%), Nemotron 3 Ultra (550B-A55B, 56.4%) и Inkling от Thinking Machines (975B-A41B, 63.8%). Тencent Hy3 с её 295B-A21B чуть впереди — 71.7%.

Но самый красноречивый показатель — DeepSWE v1.1: Laguna S 2.1 набирает 40.4%, тогда как DeepSeek-V4-Pro-Max с примерно в шесть раз большим числом активных параметров показывает лишь 9.0%. Это не опечатка — разрыв действительно такой.

На SWE-Bench Multilingual модель выдаёт 78.5% — лучший результат в опубликованной таблице, обходя даже Qwen3.7-Max (78.3%) и DeepSeek-V4-Pro-Max (76.2%). На SWE-Bench Pro — 59.4%.

Закрытые фронтирные системы — Claude Fable 5, GPT-5.6 Sol, Kimi K3 — по-прежнему лидируют на нескольких бенчмарках. Poolside и не претендует на абсолютное первенство: речь о доминировании в своей весовой категории.

Отдельно про режим мышления: без него Terminal-Bench падает с 70.2% до 60.4%, а DeepSWE — с 40.4% до 16.5%. Это самый большой разрыв между режимами среди всех моделей Laguna. Цена — токены: в режиме thinking траектории DeepSWE занимают около 249 тысяч токенов против 99 тысяч без него.

Философия упорства вместо масштаба

Главный тезис Poolside — не «мы сделали умнее», а «мы сделали настойчивее». Предыдущие Laguna-модели порой останавливались, пройдя лишь часть тестового набора, или бросали подход за два шага до успеха. В S 2.1 это поведение целенаправленно исправлено: больше верификации, меньше преждевременных выводов о победе, готовность пересматривать неудачные подходы.

Подход подкреплён постобучением на 409 000 сред — цифра, которую Poolside раскрыла в документации к релизу.

Три демонстрации живого поведения

Poolside опубликовала три необрезанные траектории, чтобы показать поведение, а не только числа.

Первая: модель построила рабочий браузерный движок с нуля — из пустой папки за 181 шаг и 50 минут, без вмешательства человека, с валидацией вывода через headless Chromium.

Вторая: оптимизация собственного агентного фреймворка Poolside — модель сделала его на 5.2% быстрее при снижении выделения памяти на 71%, заменив O(n²)-конкатенацию строк на буферы.

Третья — самая впечатляющая: независимое доказательство задачи Эрдёша №397, открытой с 1975 года. Модель работала в песочнице без Python, писала на Perl, прошла 40 шагов, сгенерировала 283 981 символ рассуждений — и всё это стоило $0.088. GPT-5.2 Pro решил эту же задачу в январе 2026-го, но дата обучения Laguna — ноябрь 2025-го, так что это действительно независимое переоткрытие.

Что это значит для рынка — и для российских разработчиков

Poolside прямо говорит о геополитическом контексте: большинство топовых открытых моделей сегодня выходят из китайских лабораторий, тогда как западные компании уводят лучшие системы за закрытые API. Laguna S 2.1 позиционируется как ответ на этот дефицит.

Для российских разработчиков картина практическая: веса доступны на Hugging Face, доступ через VPN стандартный, модель можно запустить локально — никаких API-ключей и геоблокировок не требуется. Форматы GGUF и MLX означают совместимость с llama.cpp и Mac-железом. Единственное ограничение — сам DGX Spark стоит денег, но для команд с собственными GPU-серверами это реальный вариант.

Параллельно Poolside сообщает, что более крупная модель уже в пре-тренинге. Учитывая темп — три модели за три месяца — следующий релиз можно ожидать уже осенью.

Лично меня в этой истории больше всего привлекает методологический сдвиг: вместо гонки за параметрами — инвестиции в поведение модели при долгих агентных сессиях. Если этот подход масштабируется, мы можем увидеть принципиально другую кривую эффективности в кодинговых агентах — и это интереснее очередного рекорда на MMLU.

*Информация подтверждена несколькими независимыми публикациями.*

Все эти инструменты — уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости