Laguna S 2.1: западная модель обходит DeepSeek на большинстве бенчмарков при 13x меньшем числе параметров

Маленькая модель с большими амбициями
Есть что-то особенно приятное в том, как небольшая западная лаборатория тихо выкатывает модель, которая кладет на лопатки монстров размером в разы крупнее. Именно это и сделала компания Poolside с релизом Laguna S 2.1 - и сообщество заметило это почти мгновенно. Один из реддиторов сформулировал суть лаконично: "Дешевле DeepSeek V4 Flash, лучше DeepSeek V4 Pro". Сложно придумать более убойный питч.
Что внутри: архитектура и параметры
Laguna S 2.1 построена на архитектуре Mixture-of-Experts (MoE) с общим числом параметров 118 миллиардов, из которых при обработке каждого токена активируются лишь 8 миллиардов. Это принципиально важно: реальная вычислительная нагрузка сопоставима с куда более компактными моделями, тогда как качество вывода остается на уровне значительно более тяжелых систем.
Модель поддерживает контекстное окно до 1 миллиона токенов и работает как в режиме с рассуждениями (thinking), так и без него. От старта обучения до релиза прошло менее девяти недель - темп, который сам по себе говорит о зрелости процессов в Poolside.
Цифры бенчмарков: разбираемся честно
Poolside опубликовала полные траектории для всех испытаний - редкая по нынешним временам прозрачность. Что показывают цифры?
На Terminal-Bench 2.1 Laguna S 2.1 набирает 70.2% - это 11-е место в общем зачете, но среди open-weight моделей сопоставимого размера конкурентов попросту нет. Для сравнения: DeepSeek V4 Pro Max (1.6 триллиона параметров, активных 49B) показывает лишь 64.0% - на 6 процентных пунктов хуже при общем числе параметров примерно в 13 раз больше.
На SWE-Bench Multilingual Laguna S 2.1 выдает 78.5% против 76.2% у DeepSeek V4 Pro Max. На SWE-Bench Pro - 59.4% против 55.4% у того же конкурента. На DeepSWE разрыв особенно велик: 40.4% у Laguna против 9.0% у DeepSeek V4 Pro Max. На SWE Atlas Laguna также выше: 46.2% против 27.2%.
Однако на Toolathlon Verified картина обратная: DeepSeek V4 Pro Max набирает 55.9%, тогда как Laguna S 2.1 - 49.7%. Это стоит учитывать при выборе модели под конкретные задачи.
Да, выше в таблице сидят Kimi K3 (2.8 триллиона параметров), Claude Fable 5 и GPT-5.6 в разных конфигурациях. Но их сравнение с 118B-моделью - это как сравнивать Ferrari с Toyota Yaris и удивляться, что Yaris дешевле в обслуживании.
Секрет: что изменили в обучении
CEO Poolside Эйзо Кант раскрыл детали в техническом отчете, а команда Latent Space разобрала их в подкасте. Ключевые изменения касаются постобучения (post-training): команда пересмотрела распределение задач и изменила саму логику обучающего цикла. Речь идет о целенаправленной работе с длинногоризонтными задачами - именно там, где традиционные модели теряют нить рассуждений.
Poolside делает ставку на то, что эффективность важнее масштаба. Это конкретный исследовательский выбор, который подкреплен результатами. Три модели за три месяца - такова заявленная скорость итераций лаборатории.
Позиция на рынке: западный ответ
Laguna S 2.1 - один из немногих западных open-weight проектов, который всерьез конкурирует с китайскими аналогами по соотношению цена/качество. На фоне разгорающихся споров о дистилляции - советник Белого дома Майкл Крацьос публично обвинил Moonshot AI в том, что та дистиллировала модель Anthropic Fable для создания Kimi K3, - сам факт появления конкурентоспособной западной модели приобретает дополнительный политический вес.
Для разработчиков, которым нужна мощная агентная кодинг-модель, но не хочется платить за API уровня GPT-5.6 или зависеть от китайской инфраструктуры, Laguna S 2.1 выглядит как реальная альтернатива.
Что это значит для российских пользователей
С доступностью пока не все однозначно. Poolside - американская компания, и прямой доступ к API из России, скорее всего, потребует VPN и нероссийской платежной карты. Laguna S 2.1 выпущена как open-weight модель - веса доступны на Hugging Face, - поэтому развернуть ее локально можно уже сейчас. Компактный размер делает ее пригодной для запуска на локальных машинах, что в текущем геополитическом климате далеко не мелочь.
Итог: маленький гигант
Laguna S 2.1 - это аргумент в пользу тезиса, который индустрия все еще принимает с трудом: размер модели перестает быть главным предиктором качества. Правильно выстроенное постобучение на специализированных задачах дает результаты, недостижимые простым масштабированием.
Poolside пока не самое громкое имя в индустрии. Но три конкурентоспособные модели за три месяца и результаты, которые на большинстве ключевых бенчмарков превосходят модели с параметрами в 13 раз больше, - это уже не везение. Это система.
Информация подтверждена несколькими независимыми публикациями, включая технический блог Poolside и анализ редакции Latent Space.
Источники
Похожие новости
OpenAI и Synopsys учат ИИ проектировать чипы вместе с инженерами
OpenAI и Synopsys запустили многолетнее партнерство и строят GPT-Synopsys - специализированную модель, которая умеет работать с EDA-инструментами и помогает инженерам оптимизировать дизайн полупроводников.
H Company выпустила Holo4: агент для компьютера за $0.08 за задачу
H Company открыла веса Holo4 - двух моделей для управления компьютером, которые набирают 85.2% на OSWorld и обходят GPT-5.5 по соотношению цены и результата.
Nvidia SoL-Pi режет расходы на токены кодящих агентов почти вдвое
Исследователи Nvidia научили систему SoL-Pi автоматически оптимизировать управляющий слой агентов - и получили минус 49% токенов без потери качества.