P
Генерация кодаLaguna S 2.1PoolsideDeepSeekMoEагентное кодирование

Laguna S 2.1: западная модель обходит DeepSeek на большинстве бенчмарков при 13x меньшем числе параметров

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
Laguna S 2.1: западная модель обходит DeepSeek на большинстве бенчмарков при 13x меньшем числе параметров

Маленькая модель с большими амбициями

Есть что-то особенно приятное в том, как небольшая западная лаборатория тихо выкатывает модель, которая кладет на лопатки монстров размером в разы крупнее. Именно это и сделала компания Poolside с релизом Laguna S 2.1 - и сообщество заметило это почти мгновенно. Один из реддиторов сформулировал суть лаконично: "Дешевле DeepSeek V4 Flash, лучше DeepSeek V4 Pro". Сложно придумать более убойный питч.

Что внутри: архитектура и параметры

Laguna S 2.1 построена на архитектуре Mixture-of-Experts (MoE) с общим числом параметров 118 миллиардов, из которых при обработке каждого токена активируются лишь 8 миллиардов. Это принципиально важно: реальная вычислительная нагрузка сопоставима с куда более компактными моделями, тогда как качество вывода остается на уровне значительно более тяжелых систем.

Модель поддерживает контекстное окно до 1 миллиона токенов и работает как в режиме с рассуждениями (thinking), так и без него. От старта обучения до релиза прошло менее девяти недель - темп, который сам по себе говорит о зрелости процессов в Poolside.

Цифры бенчмарков: разбираемся честно

Poolside опубликовала полные траектории для всех испытаний - редкая по нынешним временам прозрачность. Что показывают цифры?

На Terminal-Bench 2.1 Laguna S 2.1 набирает 70.2% - это 11-е место в общем зачете, но среди open-weight моделей сопоставимого размера конкурентов попросту нет. Для сравнения: DeepSeek V4 Pro Max (1.6 триллиона параметров, активных 49B) показывает лишь 64.0% - на 6 процентных пунктов хуже при общем числе параметров примерно в 13 раз больше.

На SWE-Bench Multilingual Laguna S 2.1 выдает 78.5% против 76.2% у DeepSeek V4 Pro Max. На SWE-Bench Pro - 59.4% против 55.4% у того же конкурента. На DeepSWE разрыв особенно велик: 40.4% у Laguna против 9.0% у DeepSeek V4 Pro Max. На SWE Atlas Laguna также выше: 46.2% против 27.2%.

Однако на Toolathlon Verified картина обратная: DeepSeek V4 Pro Max набирает 55.9%, тогда как Laguna S 2.1 - 49.7%. Это стоит учитывать при выборе модели под конкретные задачи.

Да, выше в таблице сидят Kimi K3 (2.8 триллиона параметров), Claude Fable 5 и GPT-5.6 в разных конфигурациях. Но их сравнение с 118B-моделью - это как сравнивать Ferrari с Toyota Yaris и удивляться, что Yaris дешевле в обслуживании.

Секрет: что изменили в обучении

CEO Poolside Эйзо Кант раскрыл детали в техническом отчете, а команда Latent Space разобрала их в подкасте. Ключевые изменения касаются постобучения (post-training): команда пересмотрела распределение задач и изменила саму логику обучающего цикла. Речь идет о целенаправленной работе с длинногоризонтными задачами - именно там, где традиционные модели теряют нить рассуждений.

Poolside делает ставку на то, что эффективность важнее масштаба. Это конкретный исследовательский выбор, который подкреплен результатами. Три модели за три месяца - такова заявленная скорость итераций лаборатории.

Позиция на рынке: западный ответ

Laguna S 2.1 - один из немногих западных open-weight проектов, который всерьез конкурирует с китайскими аналогами по соотношению цена/качество. На фоне разгорающихся споров о дистилляции - советник Белого дома Майкл Крацьос публично обвинил Moonshot AI в том, что та дистиллировала модель Anthropic Fable для создания Kimi K3, - сам факт появления конкурентоспособной западной модели приобретает дополнительный политический вес.

Для разработчиков, которым нужна мощная агентная кодинг-модель, но не хочется платить за API уровня GPT-5.6 или зависеть от китайской инфраструктуры, Laguna S 2.1 выглядит как реальная альтернатива.

Что это значит для российских пользователей

С доступностью пока не все однозначно. Poolside - американская компания, и прямой доступ к API из России, скорее всего, потребует VPN и нероссийской платежной карты. Laguna S 2.1 выпущена как open-weight модель - веса доступны на Hugging Face, - поэтому развернуть ее локально можно уже сейчас. Компактный размер делает ее пригодной для запуска на локальных машинах, что в текущем геополитическом климате далеко не мелочь.

Итог: маленький гигант

Laguna S 2.1 - это аргумент в пользу тезиса, который индустрия все еще принимает с трудом: размер модели перестает быть главным предиктором качества. Правильно выстроенное постобучение на специализированных задачах дает результаты, недостижимые простым масштабированием.

Poolside пока не самое громкое имя в индустрии. Но три конкурентоспособные модели за три месяца и результаты, которые на большинстве ключевых бенчмарков превосходят модели с параметрами в 13 раз больше, - это уже не везение. Это система.

Информация подтверждена несколькими независимыми публикациями, включая технический блог Poolside и анализ редакции Latent Space.

Источники

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости