DeepSeek V3

DeepSeek V3

Модель, с которой началась слава DeepSeek (26 декабря 2024): открытая MoE на 671B параметров с 37B активных, обученная за ~$5.6 млн — в 10-20 раз дешевле GPT-4. На старте вышла на уровень GPT-4o и Claude 3.5 Sonnet. Лицензия MIT, контекст 128K. Основа, из которой выросли V3.1 и вся линейка.

Бесплатно (открытые веса, MIT) / API от ~$0.20 за 1M входныхРаботает в РФ
7.9/10📅 2024-12-26🏢 DeepSeek✓ Open Source

Рейтинг и бенчмарки

Общий рейтинг
7.9/10
Benchmark Score
7.9/10
Скорость
8.5/10
Архитектура
MoE 671B总 / 37B активных, MLA + DeepSeekMoE
Стоимость обучения
~$5.6 млн на 2048 NVIDIA H800 за 55 дней
MATH-500
90.2
Обучение
14.8 трлн токенов
Уровень на старте
паритет с GPT-4o и Claude 3.5 Sonnet

Входные и выходные данные

Входные данные
текст
Выходные данные
текст

API и стоимость

Входные токены (Input)
Бесплатно (открытые веса, MIT) / API от ~$0.20 за 1M входных
цена за промпт
Выходные токены (Output)
~$0.80 / 1M токенов (зависит от провайдера)
цена за ответ
API доступен

Способы доступа

API (DeepSeek)Web (chat.deepseek.com)Self-hosted (Hugging Face)

Сценарии использования

чат и письмопрограммированиематематика и анализдешёвые массовые задачидообучение под свои цели

Тарифы и подписки — DeepSeek

Актуальные планы подписки провайдера. Цены могут меняться — уточняйте на странице цен

Открытые веса (self-host)
Бесплатно
  • Чекпойнты на Hugging Face (MIT + Model License)
  • Коммерческое использование разрешено
  • Дообучение под свои задачи
  • Нужен кластер GPU для 671B
Популярный
API DeepSeek
от ~$0.20 / $0.80 за 1M
  • Один из самых дешёвых API среди сильных моделей
  • Контекст 128K, вывод до 8K
  • JSON Output, Tool Calls, FIM
  • Кеширование входа даёт скидку
Сторонние провайдеры
оплата за токены
  • OpenRouter, Together AI и др.
  • Доступ для РФ через агрегаторы
  • Без собственного железа
Российские карты не принимаются.Genova-ai — работает в РФ без VPN

Плюсы и минусы

✓ Плюсы
Историческая модель: доказала, что фронтир-уровень достижим за ~$5.6 млн — в 10-20 раз дешевле, чем оценивали обучение GPT-4
Открытые веса под MIT — бесплатный локальный запуск, дообучение и коммерческое использование без ограничений
MoE-эффективность: при 671B总 активны лишь 37B параметров на токен, инференс дешевле плотных моделей того же класса
Сильная математика: 90.2 на MATH-500, а на старте модель встала вровень с GPT-4o и Claude 3.5 Sonnet
Архитектурные новшества: Multi-head Latent Attention, DeepSeekMoE, балансировка без вспомогательных потерь, multi-token prediction
Очень дешёвый API (~$0.20 за 1M входных) и доступность в России — сервис не заблокирован
✗ Минусы
Это версия декабря 2024 — линейка ушла далеко вперёд: есть V3.1 с гибридным мышлением и более свежие релизы
Не reasoning-модель: длинную цепочку рассуждений строит хуже, чем R1-0528 или современные thinking-режимы
Полный self-host 671B требует кластера GPU — дома не запустить
Официальный API DeepSeek не принимает российские карты (доступ — через агрегаторы)
Максимальный вывод 8K токенов — мало для очень длинных генераций
Только текст: без обработки изображений и других модальностей

Подробный обзор

Что такое DeepSeek V3

DeepSeek V3 — открытая языковая модель китайской лаборатории DeepSeek, вышедшая 26 декабря 2024 года. Именно с неё началась мировая известность компании. Это Mixture-of-Experts на 671 миллиард параметров, из которых на каждый токен активны лишь 37 миллиардов. Модель предобучена на 14.8 триллионах токенов и распространяется под лицензией MIT.

Главная сенсация — цена обучения

Настоящий резонанс вызвали не бенчмарки, а экономика: обучение заняло 55 дней на 2048 видеокартах NVIDIA H800 и обошлось примерно в $5.6 млн. Для сравнения, стоимость обучения GPT-4 оценивали в $50-100 млн. При этом по результатам V3 превзошла LLaMA 3.1 и Qwen 2.5 и вышла на паритет с GPT-4o и Claude 3.5 Sonnet, а на математическом тесте MATH-500 набрала 90.2. Это перевернуло представление отрасли о том, сколько стоит фронтир.

Что под капотом

  • Multi-head Latent Attention (MLA) и архитектура DeepSeekMoE — основа эффективности
  • Балансировка экспертов без вспомогательных потерь — новая на тот момент стратегия
  • Multi-token prediction в обучении — для более сильного результата
  • Контекст 128K токенов, вывод до 8K

Актуальность сегодня

Честно: V3 — это конец 2024 года, и линейка с тех пор ушла далеко вперёд. Появилась reasoning-модель R1-0528 и универсальная DeepSeek V3.1 с гибридным мышлением, где обычный и «думающий» режимы объединены. Для практической работы сегодня логичнее брать их. Но V3 остаётся важной вехой и по-прежнему рабочей моделью: дешёвый API, открытые веса под MIT и хорошая база для дообучения.

Доступность в России

Модель доступна в России: сервис chat.deepseek.com не заблокирован, а веса под MIT можно скачать с Hugging Face и запускать на своём железе без аккаунтов и карт (правда, для 671B нужен кластер). Барьер — оплата официального API: российские карты не принимаются, поэтому платный доступ проще получить через агрегаторы вроде OpenRouter или сервисы с рублёвой оплатой. Русский язык модель понимает, но отвечает точнее на английском.

Часто задаваемые вопросы

Что такое DeepSeek V3?
Открытая MoE-модель DeepSeek, вышедшая 26 декабря 2024 года: 671 млрд параметров总 при 37 млрд активных на токен, контекст 128K, лицензия MIT. Именно с неё началась известность компании — модель вышла на уровень GPT-4o и Claude 3.5 Sonnet, будучи обученной радикально дешевле.
Почему DeepSeek V3 наделала столько шума?
Из-за экономики обучения: 55 дней на 2048 видеокартах NVIDIA H800 и около $5.6 млн затрат, тогда как обучение GPT-4 оценивали в $50-100 млн. При этом по качеству модель встала вровень с топовыми закрытыми моделями того времени. Это изменило представление отрасли о стоимости создания фронтир-модели.
DeepSeek V3 актуальна в 2026 году?
Как рабочая и очень дешёвая модель — да, но линейка ушла вперёд. Сейчас логичнее брать DeepSeek V3.1 с гибридным мышлением (объединяет обычный и reasoning-режимы) или R1-0528, если нужны глубокие рассуждения. V3 остаётся хорошей базой для дообучения и историческим ориентиром.
Сколько стоит DeepSeek V3?
Веса открыты и бесплатны (MIT + Model License), можно запускать локально и использовать коммерчески — но для 671B нужен кластер GPU. Через API это один из самых дешёвых вариантов среди сильных моделей: ориентировочно от $0.20 за 1M входных и около $0.80 за 1M выходных токенов, с кешированием входа ещё дешевле.
Чем V3 отличается от R1?
V3 — обычная модель: отвечает сразу, без длинной видимой цепочки рассуждений. R1 (и особенно R1-0528) — reasoning-модель, которая «думает» перед ответом и потому сильнее в математике и логике, но медленнее и дороже по токенам. Позже DeepSeek объединила оба подхода в V3.1 с гибридным мышлением.
Работает ли DeepSeek V3 в России?
Да: сайт chat.deepseek.com не заблокирован, а открытые веса можно скачать с Hugging Face и запускать локально без карт и аккаунтов. Официальный API российские карты не принимает — платный доступ проще получить через агрегаторы (OpenRouter) или сервисы с рублёвой оплатой.

Все эти инструменты — уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно