Ollama
Генерация кодаOllamaMLXApple Siliconлокальные LLMQwen3

Ollama 0.40: модели на Apple Silicon теперь запускаются через MLX по умолчанию

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
Ollama 0.40: модели на Apple Silicon теперь запускаются через MLX по умолчанию

Если у вас Mac с чипом M-серии и вы запускаете локальные модели через Ollama - сегодня для вас хорошие новости. Версия 0.40.0, вышедшая 25 сентября в статусе RC, переключает поведение по умолчанию: архитектуры моделей, которые поддерживает MLX-раннер, теперь будут автоматически использовать именно его на Apple Silicon. Раньше нужно было явно выбирать движок или знать про флаги запуска - теперь этого не требуется.

Что такое MLX и почему это важно

MLX - фреймворк машинного обучения от Apple, заточенный под унифицированную память чипов M1/M2/M3/M4/M5. Он использует Metal-бэкенд и работает принципиально иначе, чем llama.cpp, который Ollama применяла как основной движок. Вместо того чтобы гонять данные между CPU и GPU через шину памяти, MLX работает с единым пулом памяти - именно то, для чего Apple Silicon и создавался.

Ollama начала интегрировать MLX еще в июне 2026 года, когда опубликовала подробный технический пост о производительности. Тогда команда зафиксировала прирост скорости генерации токенов до 20% по сравнению с предыдущим движком - за счет слияния нескольких операций в единые Metal-кернелы через JIT-компилятор MLX и переработки GPU-семплирования.

Проверить это просто: в официальном релизе пример запуска выглядит так - `ollama pull qwen3.8` и `ollama run qwen3.8` на любом Mac с M-чипом после обновления. Модель подхватит MLX-раннер автоматически.

NVFP4 и качество квантизации

Один из технически интересных моментов июньского обновления движка - поддержка формата NVFP4 от NVIDIA. Да, именно NVIDIA: формат изначально создавался для датацентровых GPU, но Ollama адаптировала его для работы на Apple Silicon через MLX. Это открывает возможность переносить модели, оптимизированные для датацентрового развертывания, между датацентром и десктопом.

Что дает NVFP4 на практике? При сравнении перплексии для Gemma 4 12B формат примерно вдвое снижает потерю качества относительно стандартного q4_K_M при сопоставимой скорости. Разница между квантизованным bf16 и q4_K_M ощутима - NVFP4 закрывает примерно половину этого разрыва. Для моделей, где каждая десятая перплексии имеет значение (кодинг, математика, рассуждения), это не мелочь.

Снапшоты состояния и агентные сценарии

Второй крупный блок изменений в MLX-движке касается агентных рабочих процессов. Проблема классическая: каждый вызов инструмента в агентном сценарии - это новый запрос, который переотправляет весь контекст заново. Системный промпт, определения инструментов, прочитанные файлы - все это обрабатывается снова и снова.

Ollama решила это через систему снапшотов состояния модели. Движок сохраняет состояние в точках, куда разговор с высокой вероятностью вернется: при ветвлении диалога, через интервалы в длинных промптах и перед каждым ответом. Это позволяет нескольким агентам работать параллельно, используя общий кэш для совпадающего контекста - системный промпт и определения инструментов обрабатываются единожды.

Отдельный сценарий - thinking-модели. Токены рассуждений генерируются, а потом выбрасываются из истории, что ломает стандартный prefix-кэш. Снапшот, сделанный прямо перед генерацией ответа, дает следующему запросу точку для возобновления без повторной обработки всего диалога.

Это та же технология, которую Ollama использует в своем облачном сервисе - теперь она работает локально на Mac.

Что меняется для пользователей в России

Ollama - полностью локальный инструмент с открытым исходным кодом. Никаких аккаунтов, подписок и API-ключей для локального запуска не требуется. Скачать можно с ollama.com или из репозитория на GitHub - оба ресурса доступны без VPN. Модели скачиваются с registry.ollama.ai, который тоже работает напрямую.

Обновиться до 0.40.0 можно, скачав новый установщик с сайта; на macOS и Windows обновление также может запуститься автоматически, на Linux - через повторный запуск установочного скрипта. Версия пока в статусе RC - команда тестирует и постепенно добавляет поддержку новых архитектур в MLX-раннер. Не все модели из библиотеки Ollama получат MLX по умолчанию сразу: в первую очередь это коснется архитектур, уже поддерживаемых раннером (Qwen3, Gemma 4 и ряд других).

Что это значит для экосистемы

Ollama с 182 тысячами звезд на GitHub - де-факто стандарт для запуска локальных LLM. Переход на MLX по умолчанию - это ставка на то, что Mac стал серьезной платформой для локального AI. MacBook Pro M4 Max с 128 ГБ памяти сегодня способен запускать 70-миллиардные модели с приемлемой скоростью - что год назад казалось уделом только рабочих станций.

LM Studio и Jan.ai, ближайшие конкуренты Ollama в сегменте десктопных лаунчеров, тоже поддерживают MLX, но Ollama выигрывает за счет экосистемы: интеграций с Open WebUI, Continue, Cursor и десятками других инструментов. Переключение MLX в режим по умолчанию без каких-либо действий со стороны пользователя - правильный шаг, который снижает порог входа для тех, кто не хочет разбираться в деталях.

Информация о релизе подтверждена несколькими публикациями и официальными источниками компании.

Источники

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости