L
ИИ-чатLiquid AILFM2.5спекулятивное декодированиеинференсDSpark

Liquid AI ускорила инференс в 3,2 раза без потери качества

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·5 мин чтения

Когда скорость важнее, чем кажется

Есть такая инженерная проблема, о которой в маркетинговых материалах не принято говорить вслух: современные языковые модели большую часть времени просто ждут, пока данные доедут из памяти до вычислительных блоков. Не считают - ждут. Именно поэтому ускорение инференса сегодня важнее, чем гонка за новыми параметрами. И именно поэтому релиз LFM2.5-DSpark от Liquid AI - это новость, заслуживающая серьезного внимания.

20 августа 2026 года компания выложила в открытый доступ черновые чекпоинты для трех моделей семейства LFM2.5: LFM2.5-1.2B-Instruct, LFM2.5-2.6B и смеси экспертов LFM2.5-8B-A1B. Технология называется спекулятивным декодированием - и если вы с ней еще не сталкивались, сейчас самое время разобраться.

Как работает магия ускорения

Идея спекулятивного декодирования проста и элегантна. Вместо того чтобы гонять тяжелую целевую модель для каждого токена по отдельности, запускается маленькая "черновая" модель - она быстро предлагает блок из нескольких токенов сразу. Потом целевая модель проверяет весь блок за один проход и либо принимает токены, либо отклоняет с конца блока. Если черновик угадывает правильно, вы получаете несколько токенов по цене одного прохода тяжелой модели.

DSpark использует архитектуру, впервые описанную в июльской статье исследователей DeepSeek и уже опробованную в продакшн-системе DeepSeek-V4. Три компонента: параллельный "хребет" для генерации скрытых состояний всех черновых токенов за один проход, легкая последовательная голова для моделирования зависимостей между соседними токенами, и верификатор с планированием уверенности, который отсекает слабые суффиксы раньше, чем их проверка начнет стоить дороже выигрыша.

Liquid AI реализовала это с конкретными параметрами: пять слоев, блок из девяти черновых токенов за шаг, словарь на 128 000 токенов. Каждый черновик добавляет от 295 до 328 миллионов параметров поверх целевой модели - небольшая цена за такой прирост.

Цифры, которые говорят сами за себя

Я люблю, когда компании публикуют конкретные числа, а не просто "до X раз быстрее". Liquid AI не разочаровала.

Лучший результат на GPU: LFM2.5-8B-A1B на датасете MATH500 - скорость выросла с 428 до 1362 токенов в секунду на одном H100, то есть прирост 3,18x. Это впечатляет, особенно учитывая, что речь о математических задачах, где черновик угадывает токены особенно хорошо из-за предсказуемых паттернов.

Для LFM2.5-2.6B средний прирост по пяти датасетам составил 2,67x на H100 (с 323 до 864 токенов/с) и 2,27x на MacBook с чипом M4 Max (с 61 до 139 токенов/с). Лучший результат на железе Apple - 2,87x для модели 1.2B на HumanEval: с 136 до 389 токенов/с.

Отдельная история - задержка при вызове функций. В сценариях с несколькими инструментами DSpark сократил latency на 57% в среднем для LFM2.5-2.6B. Для агентских задач на устройстве это критично: разница между 200 мс и 86 мс - это разница между "работает" и "летает".

Что это значит для практики

Чекпоинты вышли в форматах Safetensors и GGUF с поддержкой llama.cpp и SGLang с первого дня - и оба интеграции отправлены апстримом в официальные кодовые базы. Это важно: не форк, не патч, а полноценная поддержка в основных проектах. Разработчик, уже использующий llama.cpp, получает ускорение буквально обновлением модели.

Качество при этом не страдает - и это не маркетинговое утверждение, а математическая гарантия. Спекулятивное декодирование точно воспроизводит жадный вывод целевой модели: все предложенные черновиком токены проверяются целевой моделью, и если черновик ошибся - токен отклоняется. Бенчмарки точности остаются идентичными исходным.

Среднее количество принятых черновых токенов за шаг для LFM2.5-2.6B составило 4,81 из 9 - чуть больше половины. Казалось бы, не очень много, но даже такой acceptance rate дает в итоге кратный прирост скорости благодаря тому, как устроена память GPU.

Контекст: где это в общей картине

Сравните с тем, что делают конкуренты. Groq строит специализированное железо (LPU) и получает сотни токенов в секунду за счет архитектуры. Cerebras идет похожим путем. Но Liquid AI решает проблему программно - на стандартном H100 и даже на потребительском MacBook. Это принципиально другой подход к демократизации скорости.

DeepSeek в своем продакшне сообщал об ускорении на 60-85% над предыдущим базовым методом MTP-1. Liquid AI на некоторых задачах показывает больше - но прямое сравнение здесь некорректно, модели разные.

Прирост неравномерный - сами авторы честно об этом говорят. На задачах с непредсказуемым выводом (например, свободный текст) черновик угадывает хуже, acceptance rate падает, и ускорение может быть скромнее. MATH500 - это, по сути, лучший сценарий для спекулятивного декодирования.

Для российских пользователей

Модели доступны на Hugging Face - для скачивания чекпоинтов потребуется VPN или зеркало, поскольку прямой доступ к HF из РФ нестабилен. Форматы GGUF работают в llama.cpp, который запускается на любом железе, включая отечественные серверы. Для бизнеса, развертывающего LLM on-premise, DSpark - это бесплатное ускорение без каких-либо изменений в пайплайне, кроме подключения черновой модели.

Вывод

Liquid AI сделала то, что я давно жду от небольших лабораторий: взяла передовую исследовательскую идею (DSpark из июльской статьи DeepSeek), реализовала ее для своего семейства моделей и сразу интегрировала в экосистему. Никаких проприетарных систем, никаких закрытых API - просто чекпоинты и апстрим-патчи.

Если вы работаете с LFM2.5 в продакшне или экспериментируете с локальным инференсом - DSpark нужно попробовать прямо сейчас. Бесплатное ускорение в три раза бывает редко.

Источники

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости