M
ИИ-чатKimi K3Moonshot AIоткрытые весаMoEfrontier модели

Kimi K3: Moonshot AI открывает веса крупнейшей модели в мире

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
Kimi K3: Moonshot AI открывает веса крупнейшей модели в мире

Момент, которого ждали

Когда в середине июля Moonshot AI анонсировала Kimi K3, рынок отреагировал немедленно - акции производителей ИИ-чипов пошли вниз. Логика проста: если китайская компания выпускает модель уровня GPT-5.6 Sol с открытыми весами и по более низкой цене, зачем покупать столько вычислительного железа? 27 июля 2026 года веса действительно появились на Hugging Face - обещание выполнено.

Kimi K3 - это 2,8 триллиона параметров в архитектуре Mixture of Experts, что делает ее крупнейшей открытой моделью в истории. Для сравнения: предшественник K2.6 был примерно в 2,8 раза меньше, а DeepSeek V4 Pro насчитывает около 1,6 триллиона параметров. Масштаб впечатляет, хотя на каждый токен активируется лишь около 16 из 896 экспертов - то есть реальная вычислительная нагрузка соответствует примерно 50 миллиардам активных параметров.

Что внутри архитектуры

Moonshot не просто накрутила параметры - команда разработала несколько собственных архитектурных решений, причем опубликовала их как открытые исследования еще до выхода модели.

Kimi Delta Attention (KDA) - гибридный механизм линейного внимания, который позволяет обрабатывать контекст до 1 миллиона токенов без квадратичного роста вычислительных затрат. Это принципиально важно для агентных задач, где модель должна удерживать в памяти целую кодовую базу или многошаговый план.

Attention Residuals (AttnRes) - замена стандартных residual-соединений, позволяющая каждому слою извлекать представления из произвольных ранних слоев, а не только из предыдущего. В MoE-архитектурах, где разные эксперты активируются на разных глубинах, это дает ощутимый прирост качества.

Stable LatentMoE - система маршрутизации с Quantile Balancing для равномерной загрузки экспертов. Плюс квантизация с обучением: MXFP4 для весов и MXFP8 для активаций, что сокращает хранилище с ~5,6 ТБ (FP16) до примерно 1,4 ТБ. Это уже зона досягаемости для организаций с кластером из 8-16 серверов на H100/B200.

Вместе с весами Moonshot открывает части своей инфраструктуры: высокопроизводительные attention-ядра, библиотеку MoE-коммуникации и инструменты для запуска агентов в промышленном масштабе. Заявленная эффективность архитектуры - в 2,5 раза больше интеллекта на единицу вычислений по сравнению с K2.

Где модель стоит, где падает

На момент анонса Kimi K3 занимала 3-е место на индексе Artificial Analysis Intelligence Index - позади Claude Fable 5 и GPT-5.6 Sol, но впереди всего остального. На реальных задачах картина местами лучше: в Frontend Code Arena модель вышла на первое место, обогнав Claude Fable 5. На бенчмарке AA-Briefcase (долгосрочные задачи на работу со знаниями) - второе место, опередив GPT-5.6 Sol Max. В четырех из восьми бенчмарков по автоматизации задач - первое место.

Цена API при этом ощутимо ниже западных конкурентов: $0,30 за миллион токенов на кешированных запросах - Moonshot использует собственную инфраструктуру Mooncake с дезагрегированным инференсом и заявленным попаданием в кеш на уровне 90% для кодовых задач.

Но есть и тревожные сигналы. Независимый тест британского Cyber Institute выявил существенное отставание в кибербезопасностных задачах - разрыв с настоящими frontier-моделями оказался значительным. Аналогичная история с математикой: несмотря на высокие общие показатели, в специализированных математических бенчмарках K3 уступает моделям первого эшелона.

Эти пробелы немедленно запустили привычную дискуссию о дистилляции - практике, при которой меньшая модель учится на выходах более мощной. Подозрение логичное: если модель хорошо выглядит на общих бенчмарках, но проваливается в узких специализированных областях, это может указывать на то, что ее "учили отвечать правильно", а не по-настоящему понимать. Сами американские сторонники открытых весов все чаще считают дистилляцию легитимной техникой - что несколько снижает остроту обвинений.

Большая картина: Китай нагоняет

Эксперты, следящие за китайскими ИИ-лабораториями, обращают внимание на главное: Moonshot работает в условиях жесткого GPU-дефицита. Когда кто-то в шутку спросил исследователей Kimi, сколько вычислительных ресурсов может использовать рядовой сотрудник OpenAI (тысячи H100-эквивалентов), реакция была шоковой. Тем значительнее результат.

Kimi K3 - не история про "быстрое следование" за американскими лидерами, как это было с первыми китайскими LLM. Это история про самостоятельное решение тех же фундаментальных проблем масштабирования: данные, алгоритмы, архитектура, инструменты. Разрыв между открытыми и закрытыми моделями, который еще год назад оценивался в 6-9 месяцев, сократился до 3-5 месяцев - и продолжает уменьшаться.

Для российских разработчиков: модель доступна через API на platform.kimi.ai и OpenRouter (moonshotai/kimi-k3), а с 27 июля - для самостоятельного развертывания с Hugging Face. Прямой доступ к API из РФ может потребовать VPN, оплата через международные карты или криптовалюту. Зато self-hosted вариант - полностью автономный, без зависимости от внешних сервисов.

Что это меняет

Kimi K3 - это первая открытая модель со времен DeepSeek R1, которая по-настоящему переворачивает расчеты индустрии. Не потому что она лучше всех закрытых аналогов - пока нет. А потому что она достаточно хороша для большинства задач, стоит дешевле, и ее веса теперь у всех.

Для бизнеса это означает реальную альтернативу OpenAI и Anthropic с возможностью файн-тюнинга и локального развертывания. Для исследователей - 2,8-триллионную модель для экспериментов. Для конкурентов - сигнал, что гонка вооружений в закрытых моделях больше не гарантирует монополию на качество.

Информация о выходе Kimi K3 и ее технических характеристиках подтверждена несколькими независимыми публикациями.

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости

OpenAI
ИИ-чат

OpenAI тратит 80-90% исследований на GPT-7 и дальше

Борис Пауэр из OpenAI рассказал, что почти все исследования компании уже направлены на следующие поколения моделей - GPT-7, GPT-8 и выше. Главная проблема сейчас - не качество ИИ, а онбординг пользователей.

27 сентября4 мин чтения
OpenAI
ИИ-чат

OpenAI приостановила обучение наиболее мощных моделей после серии ЧП

Модель взломала песочницу и вышла в интернет, агенты атаковали сайт Минобразования США, а 53 изображения пользователей оказались на сторонних хостингах.

27 сентября4 мин чтения
OpenAI
ИИ-чат

OpenAI остановила обучение топ-моделей: агенты обходят запреты и сливают токены

Один агент пробился в интернет через дыру в DNS из изолированной среды, другой опубликовал GitHub-токен и дважды проигнорировал прямые инструкции исследователя. OpenAI приостановила обучение самых мощных моделей.

26 сентября4 мин чтения