DeepSeek V3
Модель, с которой началась слава DeepSeek (26 декабря 2024): открытая MoE на 671B параметров с 37B активных, обученная за ~$5.6 млн - в 10-20 раз дешевле GPT-4. На старте вышла на уровень GPT-4o и Claude 3.5 Sonnet. Лицензия MIT, контекст 128K. Основа, из которой выросли V3.1 и вся линейка.
Рейтинг и бенчмарки
Входные и выходные данные
API и стоимость
Способы доступа
Сценарии использования
Тарифы и подписки - DeepSeek
Актуальные планы подписки провайдера. Цены могут меняться - уточняйте на странице цен
- Чекпойнты на Hugging Face (MIT + Model License)
- Коммерческое использование разрешено
- Дообучение под свои задачи
- Нужен кластер GPU для 671B
- Один из самых дешевых API среди сильных моделей
- Контекст 128K, вывод до 8K
- JSON Output, Tool Calls, FIM
- Кеширование входа дает скидку
- OpenRouter, Together AI и др.
- Доступ для РФ через агрегаторы
- Без собственного железа
Плюсы и минусы
Подробный обзор
Что такое DeepSeek V3
DeepSeek V3 - открытая языковая модель китайской лаборатории DeepSeek, вышедшая 26 декабря 2024 года. Именно с нее началась мировая известность компании. Это Mixture-of-Experts на 671 миллиард параметров, из которых на каждый токен активны лишь 37 миллиардов. Модель предобучена на 14.8 триллионах токенов и распространяется под лицензией MIT.
Главная сенсация - цена обучения
Настоящий резонанс вызвали не бенчмарки, а экономика: обучение заняло 55 дней на 2048 видеокартах NVIDIA H800 и обошлось примерно в $5.6 млн. Для сравнения, стоимость обучения GPT-4 оценивали в $50-100 млн. При этом по результатам V3 превзошла LLaMA 3.1 и Qwen 2.5 и вышла на паритет с GPT-4o и Claude 3.5 Sonnet, а на математическом тесте MATH-500 набрала 90.2. Это перевернуло представление отрасли о том, сколько стоит фронтир.
Что под капотом
- Multi-head Latent Attention (MLA) и архитектура DeepSeekMoE - основа эффективности
- Балансировка экспертов без вспомогательных потерь - новая на тот момент стратегия
- Multi-token prediction в обучении - для более сильного результата
- Контекст 128K токенов, вывод до 8K
Актуальность сегодня
Честно: V3 - это конец 2024 года, и линейка с тех пор ушла далеко вперед. Появилась reasoning-модель R1-0528 и универсальная DeepSeek V3.1 с гибридным мышлением, где обычный и "думающий" режимы объединены. Для практической работы сегодня логичнее брать их. Но V3 остается важной вехой и по-прежнему рабочей моделью: дешевый API, открытые веса под MIT и хорошая база для дообучения.
Доступность в России
Модель доступна в России: сервис chat.deepseek.com не заблокирован, а веса под MIT можно скачать с Hugging Face и запускать на своем железе без аккаунтов и карт (правда, для 671B нужен кластер). Барьер - оплата официального API: российские карты не принимаются, поэтому платный доступ проще получить через агрегаторы вроде OpenRouter или сервисы с рублевой оплатой. Русский язык модель понимает, но отвечает точнее на английском.