L
ИИ-чатLiquid AILFM2.5спекулятивное декодированиеинференсDSpark

Liquid AI ускорила инференс в 3,2 раза без потери качества

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·5 мин чтения

Когда скорость важнее, чем кажется

Есть такая инженерная проблема, о которой в маркетинговых материалах не принято говорить вслух: современные языковые модели большую часть времени просто ждут, пока данные доедут из памяти до вычислительных блоков. Не считают — ждут. Именно поэтому ускорение инференса сегодня важнее, чем гонка за новыми параметрами. И именно поэтому релиз LFM2.5-DSpark от Liquid AI — это новость, заслуживающая серьёзного внимания.

20 августа 2026 года компания выложила в открытый доступ черновые чекпоинты для трёх моделей семейства LFM2.5: LFM2.5-1.2B-Instruct, LFM2.5-2.6B и смеси экспертов LFM2.5-8B-A1B. Технология называется спекулятивным декодированием — и если вы с ней ещё не сталкивались, сейчас самое время разобраться.

Как работает магия ускорения

Идея спекулятивного декодирования проста и элегантна. Вместо того чтобы гонять тяжёлую целевую модель для каждого токена по отдельности, запускается маленькая «черновая» модель — она быстро предлагает блок из нескольких токенов сразу. Потом целевая модель проверяет весь блок за один проход и либо принимает токены, либо отклоняет с конца блока. Ключевой момент: если черновик угадывает правильно, вы получаете несколько токенов по цене одного прохода тяжёлой модели.

DSpark использует архитектуру, впервые описанную в июльской статье исследователей DeepSeek и уже опробованную в продакшн-системе DeepSeek-V4. Три компонента: параллельный «хребет» для генерации скрытых состояний всех черновых токенов за один проход, лёгкая последовательная голова для моделирования зависимостей между соседними токенами, и верификатор с планированием уверенности, который отсекает слабые суффиксы раньше, чем их проверка начнёт стоить дороже выигрыша.

Liquid AI реализовала это с конкретными параметрами: пять слоёв, блок из девяти черновых токенов за шаг, словарь на 128 000 токенов. Каждый черновик добавляет от 295 до 328 миллионов параметров поверх целевой модели — небольшая цена за такой прирост.

Цифры, которые говорят сами за себя

Я люблю, когда компании публикуют конкретные числа, а не просто «до X раз быстрее». Liquid AI не разочаровала.

Лучший результат на GPU: LFM2.5-8B-A1B на датасете MATH500 — скорость выросла с 428 до 1362 токенов в секунду на одном H100, то есть прирост 3,18x. Это впечатляет, особенно учитывая, что речь о математических задачах, где черновик угадывает токены особенно хорошо из-за предсказуемых паттернов.

Для LFM2.5-2.6B средний прирост по пяти датасетам составил 2,67x на H100 (с 323 до 864 токенов/с) и 2,27x на MacBook с чипом M4 Max (с 61 до 139 токенов/с). Лучший результат на железе Apple — 2,87x для модели 1.2B на HumanEval: с 136 до 389 токенов/с.

Отдельная история — задержка при вызове функций. В сценариях с несколькими инструментами DSpark сократил latency на 57% в среднем для LFM2.5-2.6B. Для агентских задач на устройстве это критично: разница между 200 мс и 86 мс — это разница между «работает» и «летает».

Что это значит для практики

Чекпоинты вышли в форматах Safetensors и GGUF с поддержкой llama.cpp и SGLang с первого дня — и оба интеграции отправлены апстримом в официальные кодовые базы. Это важно: не форк, не патч, а полноценная поддержка в основных проектах. Разработчик, уже использующий llama.cpp, получает ускорение буквально обновлением модели.

Качество при этом не страдает — и это не маркетинговое утверждение, а математическая гарантия. Спекулятивное декодирование точно воспроизводит жадный вывод целевой модели: все предложенные черновиком токены проверяются целевой моделью, и если черновик ошибся — токен отклоняется. Бенчмарки точности остаются идентичными исходным.

Среднее количество принятых черновых токенов за шаг для LFM2.5-2.6B составило 4,81 из 9 — чуть больше половины. Казалось бы, не очень много, но даже такой acceptance rate даёт в итоге кратный прирост скорости благодаря тому, как устроена память GPU.

Контекст: где это в общей картине

Сравните с тем, что делают конкуренты. Groq строит специализированное железо (LPU) и получает сотни токенов в секунду за счёт архитектуры. Cerebras идёт похожим путём. Но Liquid AI решает проблему программно — на стандартном H100 и даже на потребительском MacBook. Это принципиально другой подход к демократизации скорости.

DeepSeek в своём продакшне сообщал об ускорении на 60–85% над предыдущим базовым методом MTP-1. Liquid AI на некоторых задачах показывает больше — но прямое сравнение здесь некорректно, модели разные.

Важно понимать, что прирост неравномерный — сами авторы честно об этом говорят. На задачах с непредсказуемым выводом (например, свободный текст) черновик угадывает хуже, acceptance rate падает, и ускорение может быть скромнее. MATH500 — это, по сути, лучший сценарий для спекулятивного декодирования.

Для российских пользователей

Модели доступны на Hugging Face — для скачивания чекпоинтов потребуется VPN или зеркало, поскольку прямой доступ к HF из РФ нестабилен. Форматы GGUF работают в llama.cpp, который запускается на любом железе, включая отечественные серверы. Для бизнеса, развёртывающего LLM on-premise, DSpark — это бесплатное ускорение без каких-либо изменений в пайплайне, кроме подключения черновой модели.

Вывод

Liquid AI сделала то, что я давно жду от небольших лабораторий: взяла передовую исследовательскую идею (DSpark из июльской статьи DeepSeek), реализовала её для своего семейства моделей и сразу интегрировала в экосистему. Никаких проприетарных систем, никаких закрытых API — просто чекпоинты и апстрим-патчи.

Если вы работаете с LFM2.5 в продакшне или экспериментируете с локальным инференсом — DSpark нужно попробовать прямо сейчас. Бесплатное ускорение в три раза бывает редко.

Источники

Все эти инструменты — уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости