Ollama
Генерация кодаOllamaApple SiliconQwen3 MoEMLXлокальные модели

Ollama v0.32.4: поддержка Apple Laguna и ускорение Qwen3 MoE

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
Ollama v0.32.4: поддержка Apple Laguna и ускорение Qwen3 MoE

Тихий релиз с громкими последствиями

Ollama — один из тех проектов, которые растут почти незаметно, пока внезапно не обнаруживаешь, что 177 тысяч звёзд на GitHub говорят сами за себя. Версия v0.32.4, вышедшая 25 июля, не анонсировалась под фанфары — обычный патч-релиз в духе «починили, ускорили, расширили». Но дьявол, как всегда, в деталях. И детали здесь весьма интересные.

Apple Laguna теперь в игре

Главная новость для владельцев новейшего железа от Apple — поддержка чипа Laguna через движок MLX. Это означает, что пользователи устройств на базе Laguna (а это следующее поколение после M-серии) теперь могут запускать локальные модели с полноценным использованием GPU-ускорения, а не тратить ресурсы на CPU-фоллбэк.

MLX — это фреймворк машинного обучения от Apple, и Ollama уже давно использует его как нативный бэкенд для Apple Silicon. Каждое новое поколение чипов требует явной поддержки, и команда Ollama не заставила ждать. Для сравнения: llama.cpp, альтернативный движок, нередко отстаёт на несколько недель при выходе новых архитектур. Здесь — день в день с появлением устройств в руках первых пользователей.

Speculative decoding стал умнее

Второе изменение касается квантизации выходных голов черновых моделей при создании спекулятивных черновиков. Звучит как внутренняя кухня, но на практике это важно для тех, кто использует speculative decoding — технику ускорения инференса, при которой маленькая модель-черновик предсказывает токены, а большая модель их верифицирует.

Раньше выходные головы черновой модели могли квантизоваться не в тот тип данных, что приводило к несоответствиям и потенциальным ошибкам при смешивании разных форматов. Теперь квантизация явно выполняется в запрошенный тип. Это не просто косметика — это влияет на корректность и стабильность работы при использовании смешанных конфигураций моделей.

Qwen3 MoE: починили и ускорили

Пожалуй, самое интересное изменение для пользователей, которые работают с Qwen3 MoE — моделями типа Mixture of Experts от Alibaba. В предыдущих версиях была обнаружена ошибка декодирования при работе с по-разному квантизованными экспертами внутри одной модели. Это типичная ситуация при использовании нестандартных GGUF-файлов, где разные слои могут иметь разные уровни квантизации для экономии памяти.

Исправление само по себе ценно, но вместе с ним пришла и оптимизация упакованного gate/up-проекций — тех самых матричных операций, которые в MoE-архитектурах выполняются особенно часто. Результат: прирост скорости от 4 до 9% на M5 Max. Для модели, которая и так работает быстро на Apple Silicon, это ощутимая прибавка.

Для понимания масштаба: Qwen3 MoE — это конкурент GPT-4o класса в локальном запуске, и любое ускорение инференса здесь напрямую влияет на комфорт работы. Разница между 20 и 22 токенами в секунду — это уже другое ощущение при реальном использовании.

Почему это важно для российских пользователей

Ollama работает полностью локально — никаких API-ключей, никаких зарубежных серверов, никакого VPN. Это делает его особенно привлекательным инструментом в условиях, когда доступ к облачным LLM-сервисам нестабилен или ограничен. Установка — одна команда в терминале, модели скачиваются напрямую с Ollama Library.

Поддержка Laguna особенно актуальна для тех, кто купил или планирует купить новые MacBook с последним чипом. Без этого патча пришлось бы либо ждать, либо использовать обходные пути через llama.cpp напрямую.

Конкурентный контекст

LM Studio — главный конкурент Ollama в нише локального запуска моделей — обычно реагирует на новые чипы Apple чуть быстрее с точки зрения UX, но медленнее в плане серверного API. Ollama исторически сильнее в интеграции с разработческими инструментами: его OpenAI-совместимый API используется в десятках приложений — от Continue.dev до Open WebUI.

Jan.ai и GPT4All тоже присутствуют в этом пространстве, но ни один из них не обновляется с такой частотой и не имеет сопоставимого сообщества.

Что дальше

Ollama явно держит курс на максимальную производительность на Apple Silicon — это логично, учитывая, что именно Mac-пользователи составляют значительную часть аудитории локальных LLM. Каждый новый чип Apple — это новый повод для оптимизации, и команда явно не собирается отставать.

Патч небольшой, но системный. Именно такие обновления — без громких анонсов, но с реальными улучшениями — и делают инструмент зрелым. Обновиться стоит, особенно если вы активно используете Qwen3 MoE или только что получили устройство на Laguna.

Источники

Все эти инструменты — уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости