DeepSeek дает своей Flash-модели зрение и бросает вызов Claude Opus

Глаза за $0.22 за миллион токенов
Когда DeepSeek в апреле выпустил V4-Flash, индустрия удивилась: бюджетная модель с ценником в несколько центов за миллион токенов показывала результаты, которые стыдно было бы некоторым флагманам. Теперь китайский стартап сделал следующий шаг - добавил этой модели зрение. 21 августа 2026 года компания представила DeepSeek-V4-Flash-Vision-Exp, экспериментальный мультимодальный вариант, который сохраняет все текстовые способности предшественника и добавляет полноценное понимание изображений.
На агентных бенчмарках с визуальными компонентами новая модель вплотную приближается к Anthropic Claude Opus 4.8 - и в трех тестах из одиннадцати его обходит. Это звучало бы как маркетинговое преувеличение, если бы не одна деталь: V4-Flash-Vision-Exp стоит $0.22 за миллион входящих токенов в непиковое время - примерно в десять раз дешевле Opus 4.8.
Что реально показывают цифры
DeepSeek опубликовал таблицу из одиннадцати бенчмарков. Картина неоднородная, и компания не пытается ее приукрасить. Новая модель обходит Opus 4.8 на DeepSWE (+1.3 пункта), Agents' Last Exam (+1.6) и ZeroBench (+1.0). На восьми остальных тестах она уступает - иногда незначительно (Toolathlon-Verified: 75.9 против 76.2, Terminal Bench 2.1: 83.9 против 85.0), иногда ощутимо: NL2Repo показывает разрыв в 12 пунктов (57.7 против 69.7), DSBench-Hard - около 8 пунктов.
Один показатель заслуживает отдельного внимания. AutomationBench - бенчмарк, претендующий на измерение автономных агентных способностей - дал всем трем сравниваемым моделям результаты в районе 25 баллов. Это красноречивое признание: что бы современные агенты ни умели хорошо, AutomationBench это не фиксирует. Или агенты пока не умеют достаточно.
Тут же стоит разобрать маркетинговый нюанс, который DeepSeek сам честно вынес в сноску: часть "гигантского скачка" над текстовым V4-Flash на мультимодальных тестах объясняется тем, что старая текстовая модель просто не видела изображений в этих задачах. Сравнивать зрячую модель со слепой на тесте со скриншотами - не совсем честный эксперимент. Но DeepSeek это признал прямо в таблице, а не спрятал в мелком шрифте.
Еще один занятный факт: компания пишет, что Vision-Exp "соответствует" V4-Flash по тексту. Собственные же цифры говорят о другом - на шести из семи текстовых бенчмарков мультимодальная версия превосходит текстовый предшественник. Единственное исключение - Cybergym (поиск уязвимостей в ПО), где добавление зрения обошлось потерей 1.4 пункта.
Почему сравнение с Opus 4.8, а не Opus 5
В нескольких публикациях прозвучал закономерный вопрос: Anthropic выпустил Claude Opus 5 еще 24 июля, зачем DeepSeek сравнивает себя со старшим братом? Ответ прозаичен: Opus 4.8 официально имеет статус Active на странице депрекации Anthropic - полностью поддерживается и рекомендован к использованию минимум до мая 2027 года. Это живой конкурент, а не чучело для битья.
Другой вопрос - почему в таблице нет колонки Opus 5. Ответ еще проще: никто не публиковал это сравнение. DeepSeek не заявляет, что бьет новейшую флагманскую модель Anthropic. Он заявляет, что за $0.22 за миллион токенов приближается к качественной, поддерживаемой модели за $2+. Это честная постановка.
Технические детали для разработчиков
С точки зрения интеграции модель сделана подчеркнуто удобно. Она работает через OpenAI Chat Completions и Responses API, а также через Anthropic Messages endpoint - то есть переключиться на нее можно буквально заменой одной строки в конфиге. Поддерживаются JPEG, PNG, GIF и WebP; формат определяется по содержимому файла, а не по расширению.
Обработка изображений: автоматическая нормализация до ~800×800 пикселей, максимальная длина стороны - 8192 пикселя (снижается до 4096, если в запросе больше 15 изображений). Каждое изображение обходится максимум в 384 токена независимо от исходного разрешения. За один запрос можно передать до 600 изображений.
Для загрузки картинок три варианта: Base64 в теле запроса, публичный URL (до 32 МБ) или новый Files API - загружаешь файл один раз, используешь по ID в нескольких запросах (лимит 64 МБ). Files API бесплатен.
Одновременно вышла версия 0.1.1 Harness-фреймворка DeepSeek с нативной поддержкой новой модели. Лимит одновременных запросов - 2500, что в пять раз больше, чем у V4-Pro.
Архитектура: MoE с 284 млрд параметров
V4-Flash-Vision-Exp наследует архитектуру базовой V4-Flash - Mixture of Experts с 284 млрд параметрами, где каждый эксперт содержит 13 млрд параметров. При обработке запроса активируется только один подходящий эксперт, что радикально снижает вычислительную нагрузку. Для сжатия KV-кеша используются техники HCA и CSA, сокращающие вычисления на длинных контекстах до 73%. Модель обучена на 32 триллионах токенов с применением алгоритма Muon для ускорения калибровки скрытых слоев.
Архитектуру визуального энкодера DeepSeek пока не раскрыл - это экспериментальный релиз, и компания, судя по всему, собирает обратную связь перед полноценным анонсом.
Контекст: IPO и гонка мультимодальности
Релиз вышел на фоне подготовки DeepSeek к IPO на материковом рынке Китая. По данным Bloomberg, компания ведет переговоры с банками и аудиторами, рассчитывая подать заявку в 2026 году и выйти на биржу в 2027-м. Параллельно идет новый раунд финансирования - при целевой оценке не менее 480 млрд юаней (~$71 млрд), что заметно выше $50 млрд в первом внешнем раунде с участием Tencent.
Для российских разработчиков: DeepSeek API технически доступен через прямые запросы, оплата - криптовалютой или через посредников, VPN при работе из РФ помогает стабилизировать соединение. Модель уже можно вызывать через OpenAI-совместимый интерфейс, что упрощает интеграцию в существующие пайплайны.
Моя оценка: DeepSeek последовательно делает то, что у него получается лучше всего - берет задачу, которую флагманы решают дорого, и решает ее дешево. V4-Flash-Vision-Exp - не убийца Opus 5 и не претендует на это звание. Но как рабочая лошадка для визуальных агентных пайплайнов при ценнике Flash - это серьезный аргумент для любого, кто считает деньги.
Информация подтверждена несколькими независимыми публикациями.
Похожие новости
Aleph Alpha выпустила Kolibri-1: 78B MoE с немецким языком и 1M токенов
Немецкая Aleph Alpha открыла веса модели Kolibri-1 под Apache 2.0: 78B параметров, из которых на каждый токен тратится лишь 3.46B, контекст до 1M токенов и ставка на суверенный ИИ.
Google урезает бесплатный Gemini: теперь только слабейшая модель
С октября 2026 Google оставляет бесплатным пользователям только Flash-Lite - самую слабую версию Gemini. Flash и Pro уходят за paywall.
Apple ужесточает доступ к диску Mac из-за угроз со стороны ИИ-агентов
Apple объявила о новых ограничениях для функции "полного доступа к диску" в macOS - компания прямо указала, что ИИ-агенты существенно увеличат риски для конфиденциальности пользователей по мере своего развития.