DeepSeek
ИИ-чатDeepSeekV4.1 FlashMoEмультимодальностьLLM

DeepSeek V4.1 Flash: быстрее флагмана, дешевле в 4 раза

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
DeepSeek V4.1 Flash: быстрее флагмана, дешевле в 4 раза

Flash, который убил Pro

DeepSeek тихо сделала то, что многие считали невозможным: выпустила "маленькую" модель, которая по бенчмаркам обошла собственный флагман. DeepSeek V4.1 Flash - это 552B параметров в архитектуре MoE, и при этом компания называет ее наименьшей в новой линейке. Если это минимальный размер, интересно представить, каким будет Pro.

Компания объявила о релизе сегодня, 10 сентября, и сразу же запустила новые цены - с 12:00 по пекинскому времени. Это не анонс, это живой продукт, который уже работает через API.

Архитектура, которую стоит разобрать

Главная техническая история здесь - новая структура Causal-Encoder-Decoder с асимметричными входом и выходом. Входная активация занимает 8B параметров, выходная - 16B. Это принципиально другой подход по сравнению с тем, как обычно строят трансформеры: вход и выход работают в разных режимах, что позволяет резко снизить стоимость инференса.

Еще интереснее история с KV Cache. По сравнению с предыдущим поколением потребность в HBM (быстрой памяти на GPU) упала в 4 раза, а в SSD - в 8 раз. Если смотреть на всю историю DeepSeek, KV Cache сжался в 437 раз относительно первой модели. Это не маркетинговое число - это прямая экономия на железе при деплое.

Для агентных сценариев это особенно важно. В длинных диалогах и цепочках инструментов кэш может составлять большую часть счета. Когда он становится в 8 раз меньше, стоимость агентных задач падает пропорционально.

Мультимодальность без костылей

V4.1 Flash умеет обрабатывать изображения нативно - не через отдельный энкодер, прикрученный сбоку, а как часть базовой архитектуры. Предыдущие версии Flash и Flash Vision Exp были отдельными моделями с разными именами. Теперь это одна модель, один эндпоинт.

Для разработчиков это означает упрощение: не надо решать, какую версию дергать в зависимости от типа запроса. Передал картинку - модель ее поняла. Не передал - работает как текстовая. API-имя для вызова: deepseek-flash.

Что происходит с V4 Pro

DeepSeek не просто выпустила новую модель - они объявили о плановом закате V4 Pro. С 14 сентября 2026 года в 12:00 по Пекину все запросы к deepseek-v4-pro будут перенаправляться на V4.1 Flash и тарифицироваться по его ценам.

Это смелый шаг. Компания фактически говорит: Flash теперь лучше Pro по всем параметрам - производительности, скорости, стоимости и задержкам. Зачем держать два продукта, если один объективно выигрывает?

Для пользователей, которые платили по тарифам Pro, это скорее хорошая новость: они получат тот же или лучший результат за меньшие деньги. Единственный риск - если чья-то система была откалибрована под специфическое поведение V4 Pro, придется перепроверить промпты.

Сравнение с тем, что есть на рынке

DeepSeek публикует сравнение на агентных бенчмарках, и там V4.1 Flash стоит рядом с передовыми моделями. Конкретные цифры по конкретным тестам компания приводит в техническом отчете на Hugging Face - рекомендую смотреть туда, а не верить маркетинговым таблицам из пресс-релизов.

По ощущению от архитектуры: если Gemini Flash от Google решал задачу "дешево и быстро" через дистилляцию, DeepSeek идет через архитектурную инновацию. Асимметричный энкодер-декодер - это не сжатие готовой модели, а другой способ ее построить. Посмотрим, как это скажется на качестве рассуждений в реальных задачах, а не только на бенчмарках.

Ценообразование и доступность

Действует пиковое/непиковое ценообразование: ночные часы стоят вдвое дешевле дневных. DeepSeek активно продвигает этот подход - если у вас батчевые задачи без жестких дедлайнов, запускать их ночью финансово выгодно.

Для российских пользователей ситуация стандартная для DeepSeek: API доступен, но с оговорками. Прямые платежи с российских карт исторически работают нестабильно - часть пользователей платит через посредников или используют зарубежные карты. VPN при этом обычно не требуется для API-запросов, но при регистрации могут возникнуть сложности в зависимости от IP.

Открытый исходный код

Модель выложена на Hugging Face. DeepSeek обозначила условие для желающих деплоить самостоятельно: нужно от 2000 GPU и наличие собственного хранилища. Это не домашний проект - 552B MoE требует серьезной инфраструктуры. Но для крупных компаний, которые хотят держать модель у себя, вариант существует.

WorkBuddy (включая CodeBuddy) и OpenCode уже подключили V4.1 Flash как официальные партнеры. Это означает, что разработчики, использующие эти инструменты, получат обновление автоматически.

Что это значит для рынка

DeepSeek продолжает делать одно и то же: брать архитектурные идеи, доводить их до предела и ценить ниже конкурентов. V4.1 Flash - очередное подтверждение этой стратегии. Пока OpenAI и Anthropic соревнуются в размере контекста и мультимодальных возможностях топовых моделей, DeepSeek показывает, что "быстрая" версия может превзойти вчерашний флагман.

Следующий вопрос - когда выйдет V4.1 Pro. Судя по тому, как компания описывает Flash как "наименьшую в серии", Pro должен быть значительно больше. Если Flash с 8B входной активацией уже обходит V4 Pro, что сделает полноразмерная версия - интересно посмотреть.

Источники

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости