DeepSeek даёт своей Flash-модели зрение и бросает вызов Claude Opus

Глаза за $0.22 за миллион токенов
Когда DeepSeek в апреле выпустил V4-Flash, индустрия удивилась: бюджетная модель с ценником в несколько центов за миллион токенов показывала результаты, которые стыдно было бы некоторым флагманам. Теперь китайский стартап сделал следующий шаг — добавил этой модели зрение. 21 августа 2026 года компания представила DeepSeek-V4-Flash-Vision-Exp, экспериментальный мультимодальный вариант, который сохраняет все текстовые способности предшественника и добавляет полноценное понимание изображений.
На агентных бенчмарках с визуальными компонентами новая модель вплотную приближается к Anthropic Claude Opus 4.8 — и в трёх тестах из одиннадцати его обходит. Это звучало бы как маркетинговое преувеличение, если бы не одна деталь: V4-Flash-Vision-Exp стоит $0.22 за миллион входящих токенов в непиковое время — примерно в десять раз дешевле Opus 4.8.
Что реально показывают цифры
DeepSeek опубликовал таблицу из одиннадцати бенчмарков. Картина неоднородная, и компания не пытается её приукрасить. Новая модель обходит Opus 4.8 на DeepSWE (+1.3 пункта), Agents' Last Exam (+1.6) и ZeroBench (+1.0). На восьми остальных тестах она уступает — иногда незначительно (Toolathlon-Verified: 75.9 против 76.2, Terminal Bench 2.1: 83.9 против 85.0), иногда ощутимо: NL2Repo показывает разрыв в 12 пунктов (57.7 против 69.7), DSBench-Hard — около 8 пунктов.
Один показатель заслуживает отдельного внимания. AutomationBench — бенчмарк, претендующий на измерение автономных агентных способностей — дал всем трём сравниваемым моделям результаты в районе 25 баллов. Это красноречивое признание: что бы современные агенты ни умели хорошо, AutomationBench это не фиксирует. Или агенты пока не умеют достаточно.
Тут же стоит разобрать маркетинговый нюанс, который DeepSeek сам честно вынес в сноску: часть «гигантского скачка» над текстовым V4-Flash на мультимодальных тестах объясняется тем, что старая текстовая модель просто не видела изображений в этих задачах. Сравнивать зрячую модель со слепой на тесте со скриншотами — не совсем честный эксперимент. Но DeepSeek это признал прямо в таблице, а не спрятал в мелком шрифте.
Ещё один занятный факт: компания пишет, что Vision-Exp «соответствует» V4-Flash по тексту. Собственные же цифры говорят о другом — на шести из семи текстовых бенчмарков мультимодальная версия превосходит текстовый предшественник. Единственное исключение — Cybergym (поиск уязвимостей в ПО), где добавление зрения обошлось потерей 1.4 пункта.
Почему сравнение с Opus 4.8, а не Opus 5
В нескольких публикациях прозвучал закономерный вопрос: Anthropic выпустил Claude Opus 5 ещё 24 июля, зачем DeepSeek сравнивает себя со старшим братом? Ответ прозаичен: Opus 4.8 официально имеет статус Active на странице депрекации Anthropic — полностью поддерживается и рекомендован к использованию минимум до мая 2027 года. Это живой конкурент, а не чучело для битья.
Другой вопрос — почему в таблице нет колонки Opus 5. Ответ ещё проще: никто не публиковал это сравнение. DeepSeek не заявляет, что бьёт новейшую флагманскую модель Anthropic. Он заявляет, что за $0.22 за миллион токенов приближается к качественной, поддерживаемой модели за $2+. Это честная постановка.
Технические детали для разработчиков
С точки зрения интеграции модель сделана подчёркнуто удобно. Она работает через OpenAI Chat Completions и Responses API, а также через Anthropic Messages endpoint — то есть переключиться на неё можно буквально заменой одной строки в конфиге. Поддерживаются JPEG, PNG, GIF и WebP; формат определяется по содержимому файла, а не по расширению.
Обработка изображений: автоматическая нормализация до ~800×800 пикселей, максимальная длина стороны — 8192 пикселя (снижается до 4096, если в запросе больше 15 изображений). Каждое изображение обходится максимум в 384 токена независимо от исходного разрешения. За один запрос можно передать до 600 изображений.
Для загрузки картинок три варианта: Base64 в теле запроса, публичный URL (до 32 МБ) или новый Files API — загружаешь файл один раз, используешь по ID в нескольких запросах (лимит 64 МБ). Files API бесплатен.
Одновременно вышла версия 0.1.1 Harness-фреймворка DeepSeek с нативной поддержкой новой модели. Лимит одновременных запросов — 2500, что в пять раз больше, чем у V4-Pro.
Архитектура: MoE с 284 млрд параметров
V4-Flash-Vision-Exp наследует архитектуру базовой V4-Flash — Mixture of Experts с 284 млрд параметрами, где каждый эксперт содержит 13 млрд параметров. При обработке запроса активируется только один подходящий эксперт, что радикально снижает вычислительную нагрузку. Для сжатия KV-кеша используются техники HCA и CSA, сокращающие вычисления на длинных контекстах до 73%. Модель обучена на 32 триллионах токенов с применением алгоритма Muon для ускорения калибровки скрытых слоёв.
Архитектуру визуального энкодера DeepSeek пока не раскрыл — это экспериментальный релиз, и компания, судя по всему, собирает обратную связь перед полноценным анонсом.
Контекст: IPO и гонка мультимодальности
Релиз вышел на фоне подготовки DeepSeek к IPO на материковом рынке Китая. По данным Bloomberg, компания ведёт переговоры с банками и аудиторами, рассчитывая подать заявку в 2026 году и выйти на биржу в 2027-м. Параллельно идёт новый раунд финансирования — при целевой оценке не менее 480 млрд юаней (~$71 млрд), что заметно выше $50 млрд в первом внешнем раунде с участием Tencent.
Для российских разработчиков: DeepSeek API технически доступен через прямые запросы, оплата — криптовалютой или через посредников, VPN при работе из РФ помогает стабилизировать соединение. Модель уже можно вызывать через OpenAI-совместимый интерфейс, что упрощает интеграцию в существующие пайплайны.
Моя оценка: DeepSeek последовательно делает то, что у него получается лучше всего — берёт задачу, которую флагманы решают дорого, и решает её дёшево. V4-Flash-Vision-Exp — не убийца Opus 5 и не претендует на это звание. Но как рабочая лошадка для визуальных агентных пайплайнов при ценнике Flash — это серьёзный аргумент для любого, кто считает деньги.
Информация подтверждена несколькими независимыми публикациями.
Похожие новости
Liquid AI ускорила инференс в 3,2 раза без потери качества
Liquid AI выпустила DSpark — черновики для спекулятивного декодирования LFM2.5, разгоняющие генерацию до 1362 токенов/с на H100 без изменения выходных данных.
OpenAI: нулевое хранение данных и приватная безопасность для API
OpenAI подтверждает Zero Data Retention для корпоративных клиентов и анонсирует Private Safety Processing — мониторинг угроз без доступа к пользовательским данным.
Anthropic обогнал OpenAI по выручке — впервые в истории ИИ-гонки
Anthropic заработал $11,6 млрд за квартал против $6,7 млрд у OpenAI — это переломный момент, которого никто не ожидал так скоро. Claude Code меняет расстановку сил.