Laguna S 2.1: западная модель бьёт DeepSeek при 10x меньшем размере

Маленькая модель с большими амбициями
Есть что-то особенно приятное в том, как небольшая западная лаборатория тихо выкатывает модель, которая кладёт на лопатки монстров размером в десятки раз крупнее. Именно это и сделала компания Poolside с релизом Laguna S 2.1 — и сообщество заметило это почти мгновенно. Один из реддиторов сформулировал суть лаконично: «Дешевле DeepSeek V4 Flash, лучше DeepSeek V4 Pro». Сложно придумать более убойный питч.
Что внутри: архитектура и параметры
Laguna S 2.1 построена на архитектуре Mixture-of-Experts (MoE) с общим числом параметров 118 миллиардов, из которых при обработке каждого токена активируются лишь 8 миллиардов. Это принципиально важно: реальная вычислительная нагрузка сопоставима с куда более компактными моделями, тогда как качество вывода остаётся на уровне значительно более тяжёлых систем.
Модель поддерживает контекстное окно до 1 миллиона токенов и работает как в режиме с рассуждениями (thinking), так и без него. От старта обучения до релиза прошло менее девяти недель — темп, который сам по себе говорит о зрелости процессов в Poolside.
Цифры бенчмарков: разбираемся честно
Poolside опубликовала полные траектории для всех испытаний — редкая по нынешним временам прозрачность. Что показывают цифры?
На Terminal-Bench 2.1 Laguna S 2.1 набирает 70.2% — это 11-е место в общем зачёте, но среди open-weight моделей сопоставимого размера конкурентов попросту нет. Для сравнения: DeepSeek V4 Pro Max (1.6 триллиона параметров, активных 49B) показывает лишь 64.0% — на 6 процентных пунктов хуже при параметрах в 13 раз больше.
На SWE-Bench Multilingual Laguna S 2.1 выдаёт 78.5% против 76.2% у DeepSeek V4 Pro Max. На SWE-Bench Pro — 59.4% против 55.4% у того же конкурента. На DeepSWE разрыв особенно впечатляет: 40.4% у Laguna против 9.0% у DeepSeek V4 Pro Max.
Да, выше в таблице сидят Kimi K3 (2.8 триллиона параметров), Claude Fable 5 и GPT-5.6 в разных конфигурациях. Но их сравнение с 118B-моделью — это как сравнивать Ferrari с Toyota Yaris и удивляться, что Yaris дешевле в обслуживании.
Секрет: что изменили в обучении
CEO Poolside Эйзо Кант раскрыл детали в техническом отчёте, а команда Latent Space разобрала их в подкасте. Ключевые изменения касаются постобучения (post-training): команда пересмотрела распределение задач и изменила саму логику обучающего цикла. Речь идёт о целенаправленной работе с длинногоризонтными задачами — именно там, где традиционные модели теряют нить рассуждений.
Podside делает ставку на то, что эффективность важнее масштаба. Это не просто маркетинговый тезис — это конкретный исследовательский выбор, который подкреплён результатами. Три модели за три месяца — такова заявленная скорость итераций лаборатории.
Позиция на рынке: западный ответ
Laguna S 2.1 — один из немногих западных open-weight проектов, который всерьёз конкурирует с китайскими аналогами по соотношению цена/качество. На фоне разгорающихся споров о дистилляции (Белый дом уже обвинил Moonshot AI в использовании данных Anthropic для обучения Kimi K3) сам факт появления конкурентоспособной западной модели приобретает дополнительный политический вес.
Для разработчиков, которым нужна мощная агентная кодинг-модель, но не хочется платить за API уровня GPT-5.6 или зависеть от китайской инфраструктуры, Laguna S 2.1 выглядит как реальная альтернатива. Компактный размер делает её пригодной для запуска на локальных машинах — что в текущем геополитическом климате далеко не мелочь.
Что это значит для российских пользователей
С доступностью пока не всё однозначно. Poolside — американская компания, и прямой доступ к API из России, скорее всего, потребует VPN и нероссийской платёжной карты. Однако если модель выйдет в open-weight формате (что логично следует из позиционирования), её можно будет развернуть локально — и тогда вопрос географических ограничений снимается сам собой.
Итог: маленький гигант
Laguna S 2.1 — это аргумент в пользу тезиса, который индустрия всё ещё принимает с трудом: размер модели перестаёт быть главным предиктором качества. Правильно выстроенное постобучение на специализированных задачах даёт результаты, недостижимые простым масштабированием.
Podside пока не самое громкое имя в индустрии. Но три конкурентоспособные модели за три месяца и результаты, которые бьют модели в 13 раз тяжелее — это уже не везение. Это система.
Информация подтверждена несколькими независимыми публикациями, включая технический блог Poolside и анализ редакции Latent Space.
Источники
Похожие новости
Ollama v0.32.12: поддержка Qwen3.8 27B с оптимизацией для Apple Silicon
Ollama выкатила обновление с поддержкой Qwen3.8 27B — мощной модели для кодинга и агентных задач, особо оптимизированной для чипов Apple Silicon.
GLM-5.3: китайский ИИ объявил себя лучшей открытой моделью для кода
Zhipu AI выпустила GLM-5.3 — модель с улучшением на 50% над предшественником только за счёт пост-обучения. Уже нашла 2436 уязвимостей в реальных проектах.
Gemini 3.7 Flash: Google бьёт Claude и GPT за полцены
Google выпустила Gemini 3.7 Flash всего через три недели после предшественника — и сразу вдвое снизила цену. По бенчмаркам кодинга модель обходит Claude Sonnet 5 и GPT-5.6 Terra.