P
Генерация кодаPoolsideLaguna S 2.1open-weight моделикодинговые агентыMoE

Laguna S 2.1: модель на 118B параметров уничтожает триллионников

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
Laguna S 2.1: модель на 118B параметров уничтожает триллионников

Когда размер перестаёт быть аргументом

Есть такой устоявшийся закон в мире больших языковых моделей: больше параметров — лучше результат. На графиках бенчмарков это выглядит как аккуратное облако точек, ползущее вверх вправо. И вот в это облако врывается Laguna S 2.1 от компании Poolside — 118 миллиардов параметров, которые спокойно садятся выше тренда, рядом с монстрами в 1,6 триллиона. Это либо методологический фокус, либо один из самых интересных релизов 2026 года. Судя по всему — второе.

Цифры, которые неловко игнорировать

На бенчмарке Terminal-Bench 2.1 Laguna S 2.1 набирает 70,2%. Для сравнения: DeepSeek-V4-Pro-Max с его 1,6 триллиона параметров — всего 64,0%. Thinking Machines Inkling на 975 миллиардах63,8%. NVIDIA Nemotron 3 Ultra при 550 миллиардах56,4%. Разрыв не косметический.

Но по-настоящему картина взрывается на DeepSWE — более сложном и менее «насыщенном» бенчмарке, который сложнее натаскать. Laguna S 2.1 показывает 40,4%, тогда как DeepSeek-V4-Pro-Max — 9,0%. Тринадцатикратный дефицит параметров при четырёхкратном превосходстве по результату. Именно такие цифры обычно заставляют скептиков тянуться к слову «читерство».

Poolside, очевидно, это предвидели. Они опубликовали полные траектории каждого прогона в финальном наборе оценок — любой может пройти и посмотреть, что именно делала модель на каждом шаге. Это не просто прозрачность ради PR: это принципиальная позиция, которая говорит о зрелости команды.

Кто такой Poolside и почему об этом говорят в Вашингтоне

Poolside — компания, о которой большинство разработчиков за пределами узкого круга, вероятно, слышали вскользь. Это меняется прямо сейчас. Laguna S 2.1 — первый масштабированный апгрейд от XS-модели, вышедшей несколькими неделями ранее, и он уже ставит вопросы на уровне корпоративных советов директоров и государственных регуляторов.

Контекст важен: за последний год разработчики массово сдвинулись в сторону открытых моделей — тех, что можно скачать, проверить и запустить на собственной инфраструктуре. Проблема в том, что большинство конкурентоспособных открытых весов сейчас приходят из китайских лабораторий. Западные игроки либо закрыли свои лучшие модели за API, либо ушли в государственно-ограниченные деплойменты. Laguna S 2.1 претендует на роль западного открытого флагмана — именно с таким позиционированием Poolside и выходит на рынок.

Модель распространяется под лицензией OpenMDW-1.1, веса уже доступны на Hugging Face.

Запускается на одном DGX Spark — это меняет экономику

Вот что действительно интересно с практической точки зрения: 118 миллиардов параметров помещаются на один NVIDIA DGX Spark. Это не суперкластер, не дата-центр — это одна машина, которую реально купить и поставить в серверной комнате.

Для предприятий это принципиально меняет математику. Вместо того чтобы гнать высокообъёмные агентские задачи через платные API с подсчётом каждого токена, команды могут держать модель у себя. Для государственных структур, оборонных подрядчиков и регулируемых отраслей это не просто удобство — это требование: чувствительный код и данные не должны покидать периметр.

Poolside также подчёркивает, что Laguna S 2.1 занимает размерный класс, в который ни одна западная лаборатория не выпускала открытую модель последние 11 месяцев — с момента релиза gpt-oss-120b в августе прошлого года.

Что это значит для разработчиков и бизнеса

Я бы выделил три уровня значимости этого релиза.

Первый — чисто технический: архитектура MoE (Mixture of Experts) с активными 8 миллиардами параметров из 118 при инференсе. Это объясняет, почему модель работает на одной машине и почему стоимость запроса радикально ниже, чем у гигантов. Эффективность — не побочный эффект, а намеренный дизайн.

Второй — конкурентный: на SWE-Bench Pro Laguna S 2.1 набирает 59,4%, опережая Inkling (54,3%) и DeepSeek V4-Pro Max (55,4%). Это не «почти догнали» — это лидерство среди открытых весов. Claude Sonnet 5 при 63,2% и GPT-5.6 Luna Max при 67,0% остаются выше, но они закрытые API, без возможности self-host.

Третий — геополитический: если серьёзно, то тезис о том, что «открытый ИИ — это китайский ИИ», теперь уязвим. Poolside прямо играет на этом поле, и судя по тому, кто их клиенты (госсектор, оборонка), это не случайно.

Небольшой скептицизм

При всём восхищении — несколько оговорок. Laguna S 2.1, по собственному признанию Poolside, ещё не на фронтире. Это первый scale-up, и компания честно говорит, что впереди ещё работа. Ряд сравнительных оценок взят из внешних источников (Artificial Analysis), а не из прямых тестов самой Poolside. Это нормальная практика, но при интерпретации стоит держать в уме.

Кроме того, лицензия OpenMDW-1.1 — не MIT и не Apache. Детали ограничений использования в коммерческих продуктах стоит изучить перед интеграцией.

Итог

Laguna S 2.1 — это не просто ещё один релиз модели. Это аргумент в дискуссии о том, нужны ли триллионы параметров для решения реальных задач. Судя по цифрам — нет. Нужна правильная архитектура, правильные данные и команда, которая умеет работать с агентными сценариями.

Для российской аудитории: модель доступна на Hugging Face, доступ к которому в РФ работает без VPN. Веса можно скачать напрямую. Для запуска потребуется серьёзное железо уровня DGX Spark или аналогичного, но для тех, у кого оно есть, — это один из самых интересных вариантов для self-hosted кодинговых агентов прямо сейчас.

Информация о релизе подтверждена несколькими независимыми публикациями.

Все эти инструменты — уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости