P
Генерация кодаPoolsideLaguna S 2.1open-weight моделикодинговые агентыMoE

Laguna S 2.1: модель на 118B параметров уничтожает триллионников

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
Laguna S 2.1: модель на 118B параметров уничтожает триллионников

Когда размер перестает быть аргументом

Есть такой устоявшийся закон в мире больших языковых моделей: больше параметров - лучше результат. На графиках бенчмарков это выглядит как аккуратное облако точек, ползущее вверх вправо. И вот в это облако врывается Laguna S 2.1 от компании Poolside - 118 миллиардов параметров, которые спокойно садятся выше тренда, рядом с монстрами в 1,6 триллиона. Это либо методологический фокус, либо один из самых интересных релизов 2026 года. Судя по всему - второе.

Цифры, которые неловко игнорировать

На бенчмарке Terminal-Bench 2.1 Laguna S 2.1 набирает 70,2%. Для сравнения: DeepSeek-V4-Pro-Max с его 1,6 триллиона параметров - всего 64,0%. Thinking Machines Inkling на 975 миллиардах - 63,8%. NVIDIA Nemotron 3 Ultra при 550 миллиардах - 56,4%. Разрыв не косметический.

Но по-настоящему картина взрывается на DeepSWE - более сложном и менее "насыщенном" бенчмарке, который сложнее натаскать. Laguna S 2.1 показывает 40,4%, тогда как DeepSeek-V4-Pro-Max - 9,0%. Тринадцатикратный дефицит параметров при четырехкратном превосходстве по результату. Именно такие цифры обычно заставляют скептиков тянуться к слову "читерство".

Poolside, очевидно, это предвидели. Они опубликовали полные траектории каждого прогона в финальном наборе оценок - любой может пройти и посмотреть, что именно делала модель на каждом шаге. Это не просто прозрачность ради PR: это принципиальная позиция, которая говорит о зрелости команды.

Кто такой Poolside и почему об этом говорят в Вашингтоне

Poolside - компания, о которой большинство разработчиков за пределами узкого круга, вероятно, слышали вскользь. Это меняется прямо сейчас. Laguna S 2.1 - первый масштабированный апгрейд от XS-модели, вышедшей несколькими неделями ранее, и он уже ставит вопросы на уровне корпоративных советов директоров и государственных регуляторов.

Контекст важен: за последний год разработчики массово сдвинулись в сторону открытых моделей - тех, что можно скачать, проверить и запустить на собственной инфраструктуре. Проблема в том, что большинство конкурентоспособных открытых весов сейчас приходят из китайских лабораторий. Западные игроки либо закрыли свои лучшие модели за API, либо ушли в государственно-ограниченные деплойменты. Laguna S 2.1 претендует на роль западного открытого флагмана - именно с таким позиционированием Poolside и выходит на рынок.

Модель распространяется под лицензией OpenMDW-1.1, веса уже доступны на Hugging Face.

Запускается на одном DGX Spark - это меняет экономику

Вот что действительно интересно с практической точки зрения: 118 миллиардов параметров помещаются на один NVIDIA DGX Spark. Это не суперкластер, не дата-центр - это одна машина, которую реально купить и поставить в серверной комнате.

Для предприятий это принципиально меняет математику. Вместо того чтобы гнать высокообъемные агентские задачи через платные API с подсчетом каждого токена, команды могут держать модель у себя. Для государственных структур, оборонных подрядчиков и регулируемых отраслей это не просто удобство - это требование: чувствительный код и данные не должны покидать периметр.

Poolside также подчеркивает, что Laguna S 2.1 занимает размерный класс, в который ни одна западная лаборатория не выпускала открытую модель последние 11 месяцев - с момента релиза gpt-oss-120b в августе прошлого года.

Что это значит для разработчиков и бизнеса

Я бы выделил три уровня значимости этого релиза.

Первый - чисто технический: архитектура MoE (Mixture of Experts) с активными 8 миллиардами параметров из 118 при инференсе. Это объясняет, почему модель работает на одной машине и почему стоимость запроса радикально ниже, чем у гигантов. Эффективность - не побочный эффект, а намеренный дизайн.

Второй - конкурентный: на SWE-Bench Pro Laguna S 2.1 набирает 59,4%, опережая Inkling (54,3%) и DeepSeek V4-Pro Max (55,4%). Это не "почти догнали" - это лидерство среди открытых весов. Claude Sonnet 5 при 63,2% и GPT-5.6 Luna Max при 67,0% остаются выше, но они закрытые API, без возможности self-host.

Третий - геополитический: если серьезно, то тезис о том, что "открытый ИИ - это китайский ИИ", теперь уязвим. Poolside прямо играет на этом поле, и судя по тому, кто их клиенты (госсектор, оборонка), это не случайно.

Небольшой скептицизм

При всем восхищении - несколько оговорок. Laguna S 2.1, по собственному признанию Poolside, еще не на фронтире. Это первый scale-up, и компания честно говорит, что впереди еще работа. Ряд сравнительных оценок взят из внешних источников (Artificial Analysis), а не из прямых тестов самой Poolside. Это нормальная практика, но при интерпретации стоит держать в уме.

Кроме того, лицензия OpenMDW-1.1 - не MIT и не Apache. Детали ограничений использования в коммерческих продуктах стоит изучить перед интеграцией.

Итог

Laguna S 2.1 - это не просто еще один релиз модели. Это аргумент в дискуссии о том, нужны ли триллионы параметров для решения реальных задач. Судя по цифрам - нет. Нужна правильная архитектура, правильные данные и команда, которая умеет работать с агентными сценариями.

Для российской аудитории: модель доступна на Hugging Face, доступ к которому в РФ работает без VPN. Веса можно скачать напрямую. Для запуска потребуется серьезное железо уровня DGX Spark или аналогичного, но для тех, у кого оно есть, - это один из самых интересных вариантов для self-hosted кодинговых агентов прямо сейчас.

Информация о релизе подтверждена несколькими независимыми публикациями.

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости