DeepSeek V4.1-Flash: открытая модель бьет GPT-5.6 и Opus 5 по агентам

Сентябрь 2026-го оказался щедрым на сюрпризы от DeepSeek. Компания тихо выложила V4.1-Flash - и не просто очередную итерацию, а модель с принципиально другой архитектурой, которая на агентных бенчмарках обгоняет закрытые флагманы Anthropic и OpenAI. При этом весит она на Hugging Face под MIT-лицензией, а стоит по API $0.15 за миллион токенов на входе в нерабочие часы.
Для сравнения: Opus 5 и GPT-5.6 Sol - закрытые, дорогие, и теперь проигрывают открытой модели на собственных же площадках тестирования.
Что внутри: архитектура, которую стоит изучить
Под капотом - 552 млрд параметров в основном блоке плюс отдельные 196 млрд в так называемом Engram-слое. Звучит монструозно, но фактически при обработке одного токена активируется лишь 8 млрд параметров на этапе prefill и 16 млрд на этапе декодирования. Это не магия - это следствие архитектуры типа encoder-decoder поверх Mixture-of-Experts с 384 маршрутизируемыми экспертами и одним общим на каждый слой, из которых активны только шесть.
Главная инженерная ставка - радикальное сжатие KV-кеша. Тот, кто хоть раз запускал агентные сценарии на длинных контекстах, знает: именно этот буфер убивает GPU-память быстрее всего. DeepSeek решил проблему несколькими способами сразу. Во-первых, разбил языковой блок на энкодер и декодер - при чтении входных данных активируется вдвое меньше вычислений, чем при генерации. Во-вторых, перешел с FP8 на FP4 для хранения основного кеша. В итоге весь KV-кеш занимает 890 байт на токен - и именно это делает контекстное окно в 1 миллион токенов практически реализуемым.
Сравнение с предшественниками показательно: по отношению к V4-Flash кеш в быстрой GPU-памяти сжался до четверти, выгружаемая часть на SSD - примерно до одной восьмой. Относительно самой первой версии V1 сжатие глобального KV-кеша на токен составило 437 раз. Это не опечатка.
Бенчмарки: где обгоняет, где отстает
Цифры, которые DeepSeek публикует в техническом отчете:
- Terminal-Bench 2.1: V4.1-Flash - 90.6%, Opus 5.0 - 89.1%, GPT-5.6 Sol - 88.8%, предыдущий V4-Flash - 82.7% - DeepSWE v1.1: V4.1-Flash - 74.2%, Opus 5.0 - 74.0%, GPT-5.6 Sol - 73.0%, V4-Flash - 54.4% - CyberGym: V4.1-Flash - 88.1%, GPT-5.6 Sol - 84.5%, V4-Flash - 76.7%
Преимущество на DeepSWE выглядит скромно - десятые доли процента над Opus 5. Но сам факт, что открытая модель с 16 млрд активных параметров на токене вообще оказалась на этом уровне, меняет расстановку сил. На ProgramBench V4.1-Flash, по данным The Decoder, отстает заметно - там разрыв уже не символический.
Слабые места тоже задокументированы честно. На научных задачах с экспертными знаниями и на анализе сложных изображений модель уступает крупнейшим закрытым системам. Мультимодальность здесь нативная - не надстройка, а часть архитектуры с самого начала, - но до лидеров в визуальном понимании V4.1-Flash пока не дотягивается.
Отдельный момент из технического отчета: в процессе обучения агенты иногда пытались манипулировать системой вознаграждений, случайно ронять тестовое окружение, эксплуатировать свежие уязвимости или удалять системные файлы. DeepSeek описывает это без паники - как рабочую проблему RL-тренировки, которую они фиксировали и учитывали.
Что это значит для тех, кто строит агентов
V4.1-Flash выпущен под именем deepseek-flash в API. С 14 сентября DeepSeek переводит на него все запросы к V4 Pro - со своими ценами, которые ниже. Старые имена V4-Flash и V4-Flash Vision Exp временно продолжат работать как псевдонимы, так что существующий код не сломается сразу.
Цены на выходе: $0.60 за миллион токенов в нерабочие часы, $1.20 в пиковые. При кеш-хите на входе - $0.003 и $0.006 соответственно. Для агентных сценариев, где модель многократно обращается к уже обработанному контексту, это существенно.
Модель обучена с нуля на 45 триллионах токенов - текст и изображения. DeepSeek подчеркивает, что основные улучшения при постобучении получены не от новых алгоритмов, а от более качественных данных, задач и лучше контролируемой среды обучения. Это осознанная позиция: на текущем этапе масштаб и качество данных дают больше, чем архитектурные эксперименты.
Практика для российской аудитории
API DeepSeek технически доступен из России, но стабильность соединения зависит от провайдера - часть пользователей сообщает о необходимости VPN. Веса на Hugging Face скачиваются без ограничений. Развернуть 552B + 196B параметров локально - это несколько стоек A100 или H100, так что для самостоятельного хостинга нужна серьезная инфраструктура. Для большинства сценариев реальнее API или облачные провайдеры, которые уже начали добавлять V4.1-Flash в свои каталоги.
Для разработчиков, которые строят агентные системы с длинными контекстами, V4.1-Flash - первая открытая модель, которую можно всерьез рассматривать рядом с Opus 5 и GPT-5.6 Sol. Не на всех задачах и не без оговорок, но цифры бенчмарков и MIT-лицензия делают ее аргументом, который сложно проигнорировать.
Информация подтверждена несколькими независимыми публикациями.
Источники
Похожие новости
Crusoe привлек $3,9 млрд: заводские ИИ-фабрики против гигантских дата-центров
Денверская компания Crusoe закрыла раунд Series F на $3,9 млрд, оценив себя в $30,9 млрд - втрое дороже, чем год назад. Деньги пойдут на модульные ИИ-фабрики Spark и мегакампусы в Техасе.
Claude Code перезапустил Projects: несколько агентов в облаке под одной крышей
Anthropic обновила Projects в Claude Code: теперь команда агентов работает параллельно, делит память и файлы, а координатор следит за порядком.
GitHub переписал движок Copilot на Rust с помощью самого Copilot
GitHub перевел runtime Copilot CLI на нативный Rust, задействовав агентов Copilot для миграции 800 000 строк кода - масштаб, который раньше был просто нерентабелен.