M
ИИ-чатKimi K3Moonshot AIоткрытые весаMoEfrontier модели

Kimi K3: Moonshot AI открывает веса крупнейшей модели в мире

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
Kimi K3: Moonshot AI открывает веса крупнейшей модели в мире

Момент, которого ждали

Когда в середине июля Moonshot AI анонсировала Kimi K3, рынок отреагировал немедленно — акции производителей ИИ-чипов пошли вниз. Логика проста: если китайская компания выпускает модель уровня GPT-5.6 Sol с открытыми весами и по более низкой цене, зачем покупать столько вычислительного железа? 27 июля 2026 года веса действительно появились на Hugging Face — обещание выполнено.

Kimi K3 — это 2,8 триллиона параметров в архитектуре Mixture of Experts, что делает её крупнейшей открытой моделью в истории. Для сравнения: предшественник K2.6 был примерно в 2,8 раза меньше, а DeepSeek V4 Pro насчитывает около 1,6 триллиона параметров. Масштаб впечатляет, хотя на каждый токен активируется лишь около 16 из 896 экспертов — то есть реальная вычислительная нагрузка соответствует примерно 50 миллиардам активных параметров.

Что внутри архитектуры

Moonshot не просто накрутила параметры — команда разработала несколько собственных архитектурных решений, причём опубликовала их как открытые исследования ещё до выхода модели.

Kimi Delta Attention (KDA) — гибридный механизм линейного внимания, который позволяет обрабатывать контекст до 1 миллиона токенов без квадратичного роста вычислительных затрат. Это принципиально важно для агентных задач, где модель должна удерживать в памяти целую кодовую базу или многошаговый план.

Attention Residuals (AttnRes) — замена стандартных residual-соединений, позволяющая каждому слою извлекать представления из произвольных ранних слоёв, а не только из предыдущего. В MoE-архитектурах, где разные эксперты активируются на разных глубинах, это даёт ощутимый прирост качества.

Stable LatentMoE — система маршрутизации с Quantile Balancing для равномерной загрузки экспертов. Плюс квантизация с обучением: MXFP4 для весов и MXFP8 для активаций, что сокращает хранилище с ~5,6 ТБ (FP16) до примерно 1,4 ТБ. Это уже зона досягаемости для организаций с кластером из 8–16 серверов на H100/B200.

Вместе с весами Moonshot открывает части своей инфраструктуры: высокопроизводительные attention-ядра, библиотеку MoE-коммуникации и инструменты для запуска агентов в промышленном масштабе. Заявленная эффективность архитектуры — в 2,5 раза больше интеллекта на единицу вычислений по сравнению с K2.

Где модель стоит, где падает

На момент анонса Kimi K3 занимала 3-е место на индексе Artificial Analysis Intelligence Index — позади Claude Fable 5 и GPT-5.6 Sol, но впереди всего остального. На реальных задачах картина местами лучше: в Frontend Code Arena модель вышла на первое место, обогнав Claude Fable 5. На бенчмарке AA-Briefcase (долгосрочные задачи на работу со знаниями) — второе место, опередив GPT-5.6 Sol Max. В четырёх из восьми бенчмарков по автоматизации задач — первое место.

Цена API при этом ощутимо ниже западных конкурентов: $0,30 за миллион токенов на кешированных запросах — Moonshot использует собственную инфраструктуру Mooncake с дезагрегированным инференсом и заявленным попаданием в кеш на уровне 90% для кодовых задач.

Но есть и тревожные сигналы. Независимый тест британского Cyber Institute выявил существенное отставание в кибербезопасностных задачах — разрыв с настоящими frontier-моделями оказался значительным. Аналогичная история с математикой: несмотря на высокие общие показатели, в специализированных математических бенчмарках K3 уступает моделям первого эшелона.

Эти пробелы немедленно запустили привычную дискуссию о дистилляции — практике, при которой меньшая модель учится на выходах более мощной. Подозрение логичное: если модель хорошо выглядит на общих бенчмарках, но проваливается в узких специализированных областях, это может указывать на то, что её «учили отвечать правильно», а не по-настоящему понимать. Сами американские сторонники открытых весов всё чаще считают дистилляцию легитимной техникой — что несколько снижает остроту обвинений.

Большая картина: Китай нагоняет

Эксперты, следящие за китайскими ИИ-лабораториями, обращают внимание на главное: Moonshot работает в условиях жёсткого GPU-дефицита. Когда кто-то в шутку спросил исследователей Kimi, сколько вычислительных ресурсов может использовать рядовой сотрудник OpenAI (тысячи H100-эквивалентов), реакция была шоковой. Тем значительнее результат.

Kimi K3 — не история про «быстрое следование» за американскими лидерами, как это было с первыми китайскими LLM. Это история про самостоятельное решение тех же фундаментальных проблем масштабирования: данные, алгоритмы, архитектура, инструменты. Разрыв между открытыми и закрытыми моделями, который ещё год назад оценивался в 6–9 месяцев, сократился до 3–5 месяцев — и продолжает уменьшаться.

Для российских разработчиков: модель доступна через API на platform.kimi.ai и OpenRouter (moonshotai/kimi-k3), а с 27 июля — для самостоятельного развёртывания с Hugging Face. Прямой доступ к API из РФ может потребовать VPN, оплата через международные карты или криптовалюту. Зато self-hosted вариант — полностью автономный, без зависимости от внешних сервисов.

Что это меняет

Kimi K3 — это первая открытая модель со времён DeepSeek R1, которая по-настоящему переворачивает расчёты индустрии. Не потому что она лучше всех закрытых аналогов — пока нет. А потому что она достаточно хороша для большинства задач, стоит дешевле, и её веса теперь у всех.

Для бизнеса это означает реальную альтернативу OpenAI и Anthropic с возможностью файн-тюнинга и локального развёртывания. Для исследователей — 2,8-триллионную модель для экспериментов. Для конкурентов — сигнал, что гонка вооружений в закрытых моделях больше не гарантирует монополию на качество.

Информация о выходе Kimi K3 и её технических характеристиках подтверждена несколькими независимыми публикациями.

Все эти инструменты — уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости