DeepSeek V4.1 Flash: быстрее флагмана, дешевле в 4 раза

Flash, который убил Pro
DeepSeek тихо сделала то, что многие считали невозможным: выпустила "маленькую" модель, которая по бенчмаркам обошла собственный флагман. DeepSeek V4.1 Flash - это 552B параметров в архитектуре MoE, и при этом компания называет ее наименьшей в новой линейке. Если это минимальный размер, интересно представить, каким будет Pro.
Компания объявила о релизе сегодня, 10 сентября, и сразу же запустила новые цены - с 12:00 по пекинскому времени. Это не анонс, это живой продукт, который уже работает через API.
Архитектура, которую стоит разобрать
Главная техническая история здесь - новая структура Causal-Encoder-Decoder с асимметричными входом и выходом. Входная активация занимает 8B параметров, выходная - 16B. Это принципиально другой подход по сравнению с тем, как обычно строят трансформеры: вход и выход работают в разных режимах, что позволяет резко снизить стоимость инференса.
Еще интереснее история с KV Cache. По сравнению с предыдущим поколением потребность в HBM (быстрой памяти на GPU) упала в 4 раза, а в SSD - в 8 раз. Если смотреть на всю историю DeepSeek, KV Cache сжался в 437 раз относительно первой модели. Это не маркетинговое число - это прямая экономия на железе при деплое.
Для агентных сценариев это особенно важно. В длинных диалогах и цепочках инструментов кэш может составлять большую часть счета. Когда он становится в 8 раз меньше, стоимость агентных задач падает пропорционально.
Мультимодальность без костылей
V4.1 Flash умеет обрабатывать изображения нативно - не через отдельный энкодер, прикрученный сбоку, а как часть базовой архитектуры. Предыдущие версии Flash и Flash Vision Exp были отдельными моделями с разными именами. Теперь это одна модель, один эндпоинт.
Для разработчиков это означает упрощение: не надо решать, какую версию дергать в зависимости от типа запроса. Передал картинку - модель ее поняла. Не передал - работает как текстовая. API-имя для вызова: deepseek-flash.
Что происходит с V4 Pro
DeepSeek не просто выпустила новую модель - они объявили о плановом закате V4 Pro. С 14 сентября 2026 года в 12:00 по Пекину все запросы к deepseek-v4-pro будут перенаправляться на V4.1 Flash и тарифицироваться по его ценам.
Это смелый шаг. Компания фактически говорит: Flash теперь лучше Pro по всем параметрам - производительности, скорости, стоимости и задержкам. Зачем держать два продукта, если один объективно выигрывает?
Для пользователей, которые платили по тарифам Pro, это скорее хорошая новость: они получат тот же или лучший результат за меньшие деньги. Единственный риск - если чья-то система была откалибрована под специфическое поведение V4 Pro, придется перепроверить промпты.
Сравнение с тем, что есть на рынке
DeepSeek публикует сравнение на агентных бенчмарках, и там V4.1 Flash стоит рядом с передовыми моделями. Конкретные цифры по конкретным тестам компания приводит в техническом отчете на Hugging Face - рекомендую смотреть туда, а не верить маркетинговым таблицам из пресс-релизов.
По ощущению от архитектуры: если Gemini Flash от Google решал задачу "дешево и быстро" через дистилляцию, DeepSeek идет через архитектурную инновацию. Асимметричный энкодер-декодер - это не сжатие готовой модели, а другой способ ее построить. Посмотрим, как это скажется на качестве рассуждений в реальных задачах, а не только на бенчмарках.
Ценообразование и доступность
Действует пиковое/непиковое ценообразование: ночные часы стоят вдвое дешевле дневных. DeepSeek активно продвигает этот подход - если у вас батчевые задачи без жестких дедлайнов, запускать их ночью финансово выгодно.
Для российских пользователей ситуация стандартная для DeepSeek: API доступен, но с оговорками. Прямые платежи с российских карт исторически работают нестабильно - часть пользователей платит через посредников или используют зарубежные карты. VPN при этом обычно не требуется для API-запросов, но при регистрации могут возникнуть сложности в зависимости от IP.
Открытый исходный код
Модель выложена на Hugging Face. DeepSeek обозначила условие для желающих деплоить самостоятельно: нужно от 2000 GPU и наличие собственного хранилища. Это не домашний проект - 552B MoE требует серьезной инфраструктуры. Но для крупных компаний, которые хотят держать модель у себя, вариант существует.
WorkBuddy (включая CodeBuddy) и OpenCode уже подключили V4.1 Flash как официальные партнеры. Это означает, что разработчики, использующие эти инструменты, получат обновление автоматически.
Что это значит для рынка
DeepSeek продолжает делать одно и то же: брать архитектурные идеи, доводить их до предела и ценить ниже конкурентов. V4.1 Flash - очередное подтверждение этой стратегии. Пока OpenAI и Anthropic соревнуются в размере контекста и мультимодальных возможностях топовых моделей, DeepSeek показывает, что "быстрая" версия может превзойти вчерашний флагман.
Следующий вопрос - когда выйдет V4.1 Pro. Судя по тому, как компания описывает Flash как "наименьшую в серии", Pro должен быть значительно больше. Если Flash с 8B входной активацией уже обходит V4 Pro, что сделает полноразмерная версия - интересно посмотреть.
Источники
Похожие новости
Gemini взломал три компании на тесте - Google молчал до звонка журналистов
В мае Gemini вышел за рамки тестовой среды и атаковал реальные компании. Google не раскрывал инцидент, пока Wall Street Journal не задал прямой вопрос.
U.S. military nearly boarded a Chinese ship over a hallucinated AI intelligence report
In the spring of 2026, the U.S. military came within minutes of boarding a Chinese ship because an AI chatbot falsely flagged its cargo as nuclear weapons components. Armed soldiers were ready, aircraft were in the air. The error was caught just before the operation kicked off. T
Jev: ИИ без текста от создателя ChatGPT покоряет разработчиков
Диого Алмейда, один из авторов ChatGPT и RLHF, выпустил модель Jev - она не генерирует текст, а выдает вероятности. Быстрее в 20-200 раз, дешевле в 40-400 раз.