DeepSeek
Китайская AI-компания, разрабатывающая большие языковые модели (LLM) с открытыми весами для задач чата, программирования и рассуждений.
О компании
DeepSeek (полное название - Hangzhou DeepSeek Artificial Intelligence Basic Technology Research Co., Ltd.) - китайская компания в области искусственного интеллекта, основанная в июле 2023 года Лян Вэньфэном, сооснователем хедж-фонда High-Flyer. Компания базируется в Ханчжоу (провинция Чжэцзян) и полностью финансируется фондом High-Flyer, без привлечения венчурного капитала.
DeepSeek специализируется на разработке больших языковых моделей с открытыми весами. Первая модель - DeepSeek Coder - была выпущена в ноябре 2023 года. В январе 2025 года компания выпустила модель DeepSeek-R1 и одноименное чат-приложение, которое стало самым скачиваемым бесплатным приложением в App Store США, обогнав ChatGPT, что вызвало волну обсуждений о 'Спутниковом моменте' для американской AI-индустрии.
Ключевое преимущество DeepSeek - исключительная вычислительная эффективность: обучение модели V3 обошлось примерно в $5,6 млн против сотен миллионов у конкурентов. Компания придерживается исследовательской миссии - достижения искусственного общего интеллекта (AGI) - и не ставит коммерциализацию в приоритет. Продуктовая линейка включает модели для чата, программирования (DeepSeek Coder), математики и мультимодальные решения, доступные через веб-интерфейс, мобильное приложение и API.
Все модели DeepSeek (9)
💬ИИ-чат (7)
Две модели под свободной лицензией MIT (24 апреля 2026): V4-Pro на 1.6 трлн параметров и V4-Flash на 284 млрд. Контекст 1 млн токенов, вывод до 384K. SWE-bench Verified 80.6% - лучший результат среди моделей с открытыми весами, рейтинг Codeforces 3206. Практический вывод: младшая Flash дает почти те же цифры втрое дешевле.
Открытая reasoning-модель DeepSeek уровня OpenAI o1 - но дешевле в десятки раз. MoE 671B (37B активных), лицензия MIT, обновление R1-0528 (май 2025) подтянуло качество к o3 и Gemini 2.5 Pro. Работает в России без VPN, есть 6 дистиллированных версий для слабого железа.
Гибридная модель с быстрым и медленным режимами мышления.
Модель, с которой началась слава DeepSeek (26 декабря 2024): открытая MoE на 671B параметров с 37B активных, обученная за ~$5.6 млн - в 10-20 раз дешевле GPT-4. На старте вышла на уровень GPT-4o и Claude 3.5 Sonnet. Лицензия MIT, контекст 128K. Основа, из которой выросли V3.1 и вся линейка.
Экспериментальная модель рассуждений без supervised fine-tuning.
Открытая модель для математических задач и формального доказательства.
Полностью мультимодальная открытая модель для текста и изображений.
💻Генерация кода (2)
Обновленная reasoning-модель DeepSeek (28 мая 2025): MoE на 671B с 37B активных, глубокие пошаговые рассуждения. Скачок в математике - AIME 2025 87.5% против 70% у первой R1 - и результаты на уровне OpenAI o3 и Gemini 2.5 Pro. Открытые веса под MIT. Позже линейка ушла в DeepSeek V3.1 с гибридным мышлением.
Открытая модель для генерации и анализа кода с высокой производительностью.
Последние новости DeepSeek
DeepSeek выпустил V4.1-Flash - 552 млрд параметров, MIT-лицензия, KV-кеш в четверть от предшественника. На DeepSWE v1.1 модель обходит Opus 5 и GPT-5.6 Sol.
DeepSeek выпустила V4.1 Flash - 552B MoE-модель с нативным мультимодальным зрением, которая обошла V4 Pro по всем метрикам. Компания снизила цены благодаря архитектурным изменениям.
DeepSeek выпустил экспериментальную мультимодальную модель V4-Flash-Vision-Exp, которая видит изображения и на агентных бенчмарках вплотную подходит к Anthropic Opus 4.8 - за десятую часть его цены.
DeepSeek выпустил DSpark - фреймворк спекулятивного декодирования, ускоряющий ответы ИИ на 60-85%. Это прямой удар по санкционной логике США.
Китайский ИИ-стартап DeepSeek впервые открылся для внешних инвесторов, собрав более 50 млрд юаней. Среди вкладчиков - Tencent и CATL, но голосовых прав они не получили.