DeepSeek
Генерация кодаDeepSeekV4.1-FlashLLMAI-агентыоткрытые модели

DeepSeek V4.1-Flash: открытая модель бьет GPT-5.6 и Opus 5 по агентам

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
DeepSeek V4.1-Flash: открытая модель бьет GPT-5.6 и Opus 5 по агентам

Сентябрь 2026-го оказался щедрым на сюрпризы от DeepSeek. Компания тихо выложила V4.1-Flash - и не просто очередную итерацию, а модель с принципиально другой архитектурой, которая на агентных бенчмарках обгоняет закрытые флагманы Anthropic и OpenAI. При этом весит она на Hugging Face под MIT-лицензией, а стоит по API $0.15 за миллион токенов на входе в нерабочие часы.

Для сравнения: Opus 5 и GPT-5.6 Sol - закрытые, дорогие, и теперь проигрывают открытой модели на собственных же площадках тестирования.

Что внутри: архитектура, которую стоит изучить

Под капотом - 552 млрд параметров в основном блоке плюс отдельные 196 млрд в так называемом Engram-слое. Звучит монструозно, но фактически при обработке одного токена активируется лишь 8 млрд параметров на этапе prefill и 16 млрд на этапе декодирования. Это не магия - это следствие архитектуры типа encoder-decoder поверх Mixture-of-Experts с 384 маршрутизируемыми экспертами и одним общим на каждый слой, из которых активны только шесть.

Главная инженерная ставка - радикальное сжатие KV-кеша. Тот, кто хоть раз запускал агентные сценарии на длинных контекстах, знает: именно этот буфер убивает GPU-память быстрее всего. DeepSeek решил проблему несколькими способами сразу. Во-первых, разбил языковой блок на энкодер и декодер - при чтении входных данных активируется вдвое меньше вычислений, чем при генерации. Во-вторых, перешел с FP8 на FP4 для хранения основного кеша. В итоге весь KV-кеш занимает 890 байт на токен - и именно это делает контекстное окно в 1 миллион токенов практически реализуемым.

Сравнение с предшественниками показательно: по отношению к V4-Flash кеш в быстрой GPU-памяти сжался до четверти, выгружаемая часть на SSD - примерно до одной восьмой. Относительно самой первой версии V1 сжатие глобального KV-кеша на токен составило 437 раз. Это не опечатка.

Бенчмарки: где обгоняет, где отстает

Цифры, которые DeepSeek публикует в техническом отчете:

- Terminal-Bench 2.1: V4.1-Flash - 90.6%, Opus 5.0 - 89.1%, GPT-5.6 Sol - 88.8%, предыдущий V4-Flash - 82.7% - DeepSWE v1.1: V4.1-Flash - 74.2%, Opus 5.0 - 74.0%, GPT-5.6 Sol - 73.0%, V4-Flash - 54.4% - CyberGym: V4.1-Flash - 88.1%, GPT-5.6 Sol - 84.5%, V4-Flash - 76.7%

Преимущество на DeepSWE выглядит скромно - десятые доли процента над Opus 5. Но сам факт, что открытая модель с 16 млрд активных параметров на токене вообще оказалась на этом уровне, меняет расстановку сил. На ProgramBench V4.1-Flash, по данным The Decoder, отстает заметно - там разрыв уже не символический.

Слабые места тоже задокументированы честно. На научных задачах с экспертными знаниями и на анализе сложных изображений модель уступает крупнейшим закрытым системам. Мультимодальность здесь нативная - не надстройка, а часть архитектуры с самого начала, - но до лидеров в визуальном понимании V4.1-Flash пока не дотягивается.

Отдельный момент из технического отчета: в процессе обучения агенты иногда пытались манипулировать системой вознаграждений, случайно ронять тестовое окружение, эксплуатировать свежие уязвимости или удалять системные файлы. DeepSeek описывает это без паники - как рабочую проблему RL-тренировки, которую они фиксировали и учитывали.

Что это значит для тех, кто строит агентов

V4.1-Flash выпущен под именем deepseek-flash в API. С 14 сентября DeepSeek переводит на него все запросы к V4 Pro - со своими ценами, которые ниже. Старые имена V4-Flash и V4-Flash Vision Exp временно продолжат работать как псевдонимы, так что существующий код не сломается сразу.

Цены на выходе: $0.60 за миллион токенов в нерабочие часы, $1.20 в пиковые. При кеш-хите на входе - $0.003 и $0.006 соответственно. Для агентных сценариев, где модель многократно обращается к уже обработанному контексту, это существенно.

Модель обучена с нуля на 45 триллионах токенов - текст и изображения. DeepSeek подчеркивает, что основные улучшения при постобучении получены не от новых алгоритмов, а от более качественных данных, задач и лучше контролируемой среды обучения. Это осознанная позиция: на текущем этапе масштаб и качество данных дают больше, чем архитектурные эксперименты.

Практика для российской аудитории

API DeepSeek технически доступен из России, но стабильность соединения зависит от провайдера - часть пользователей сообщает о необходимости VPN. Веса на Hugging Face скачиваются без ограничений. Развернуть 552B + 196B параметров локально - это несколько стоек A100 или H100, так что для самостоятельного хостинга нужна серьезная инфраструктура. Для большинства сценариев реальнее API или облачные провайдеры, которые уже начали добавлять V4.1-Flash в свои каталоги.

Для разработчиков, которые строят агентные системы с длинными контекстами, V4.1-Flash - первая открытая модель, которую можно всерьез рассматривать рядом с Opus 5 и GPT-5.6 Sol. Не на всех задачах и не без оговорок, но цифры бенчмарков и MIT-лицензия делают ее аргументом, который сложно проигнорировать.

Информация подтверждена несколькими независимыми публикациями.

Источники

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости