DeepSeek V3
Модель, с которой началась слава DeepSeek (26 декабря 2024): открытая MoE на 671B параметров с 37B активных, обученная за ~$5.6 млн — в 10-20 раз дешевле GPT-4. На старте вышла на уровень GPT-4o и Claude 3.5 Sonnet. Лицензия MIT, контекст 128K. Основа, из которой выросли V3.1 и вся линейка.
Рейтинг и бенчмарки
Входные и выходные данные
API и стоимость
Способы доступа
Сценарии использования
Тарифы и подписки — DeepSeek
Актуальные планы подписки провайдера. Цены могут меняться — уточняйте на странице цен
- Чекпойнты на Hugging Face (MIT + Model License)
- Коммерческое использование разрешено
- Дообучение под свои задачи
- Нужен кластер GPU для 671B
- Один из самых дешёвых API среди сильных моделей
- Контекст 128K, вывод до 8K
- JSON Output, Tool Calls, FIM
- Кеширование входа даёт скидку
- OpenRouter, Together AI и др.
- Доступ для РФ через агрегаторы
- Без собственного железа
Плюсы и минусы
Подробный обзор
Что такое DeepSeek V3
DeepSeek V3 — открытая языковая модель китайской лаборатории DeepSeek, вышедшая 26 декабря 2024 года. Именно с неё началась мировая известность компании. Это Mixture-of-Experts на 671 миллиард параметров, из которых на каждый токен активны лишь 37 миллиардов. Модель предобучена на 14.8 триллионах токенов и распространяется под лицензией MIT.
Главная сенсация — цена обучения
Настоящий резонанс вызвали не бенчмарки, а экономика: обучение заняло 55 дней на 2048 видеокартах NVIDIA H800 и обошлось примерно в $5.6 млн. Для сравнения, стоимость обучения GPT-4 оценивали в $50-100 млн. При этом по результатам V3 превзошла LLaMA 3.1 и Qwen 2.5 и вышла на паритет с GPT-4o и Claude 3.5 Sonnet, а на математическом тесте MATH-500 набрала 90.2. Это перевернуло представление отрасли о том, сколько стоит фронтир.
Что под капотом
- Multi-head Latent Attention (MLA) и архитектура DeepSeekMoE — основа эффективности
- Балансировка экспертов без вспомогательных потерь — новая на тот момент стратегия
- Multi-token prediction в обучении — для более сильного результата
- Контекст 128K токенов, вывод до 8K
Актуальность сегодня
Честно: V3 — это конец 2024 года, и линейка с тех пор ушла далеко вперёд. Появилась reasoning-модель R1-0528 и универсальная DeepSeek V3.1 с гибридным мышлением, где обычный и «думающий» режимы объединены. Для практической работы сегодня логичнее брать их. Но V3 остаётся важной вехой и по-прежнему рабочей моделью: дешёвый API, открытые веса под MIT и хорошая база для дообучения.
Доступность в России
Модель доступна в России: сервис chat.deepseek.com не заблокирован, а веса под MIT можно скачать с Hugging Face и запускать на своём железе без аккаунтов и карт (правда, для 671B нужен кластер). Барьер — оплата официального API: российские карты не принимаются, поэтому платный доступ проще получить через агрегаторы вроде OpenRouter или сервисы с рублёвой оплатой. Русский язык модель понимает, но отвечает точнее на английском.