Ollama 0.40: модели на Apple Silicon теперь запускаются через MLX по умолчанию
Если у вас Mac с чипом M-серии и вы запускаете локальные модели через Ollama - сегодня для вас хорошие новости. Версия 0.40.0, вышедшая 25 сентября в статусе RC, переключает поведение по умолчанию: архитектуры моделей, которые поддерживает MLX-раннер, теперь будут автоматически использовать именно его на Apple Silicon. Раньше нужно было явно выбирать движок или знать про флаги запуска - теперь этого не требуется.
Что такое MLX и почему это важно
MLX - фреймворк машинного обучения от Apple, заточенный под унифицированную память чипов M1/M2/M3/M4/M5. Он использует Metal-бэкенд и работает принципиально иначе, чем llama.cpp, который Ollama применяла как основной движок. Вместо того чтобы гонять данные между CPU и GPU через шину памяти, MLX работает с единым пулом памяти - именно то, для чего Apple Silicon и создавался.
Ollama начала интегрировать MLX еще в июне 2026 года, когда опубликовала подробный технический пост о производительности. Тогда команда зафиксировала прирост скорости генерации токенов до 20% по сравнению с предыдущим движком - за счет слияния нескольких операций в единые Metal-кернелы через JIT-компилятор MLX и переработки GPU-семплирования.
Проверить это просто: в официальном релизе пример запуска выглядит так - `ollama pull qwen3.8` и `ollama run qwen3.8` на любом Mac с M-чипом после обновления. Модель подхватит MLX-раннер автоматически.
NVFP4 и качество квантизации
Один из технически интересных моментов июньского обновления движка - поддержка формата NVFP4 от NVIDIA. Да, именно NVIDIA: формат изначально создавался для датацентровых GPU, но Ollama адаптировала его для работы на Apple Silicon через MLX. Это открывает возможность переносить модели, оптимизированные для датацентрового развертывания, между датацентром и десктопом.
Что дает NVFP4 на практике? При сравнении перплексии для Gemma 4 12B формат примерно вдвое снижает потерю качества относительно стандартного q4_K_M при сопоставимой скорости. Разница между квантизованным bf16 и q4_K_M ощутима - NVFP4 закрывает примерно половину этого разрыва. Для моделей, где каждая десятая перплексии имеет значение (кодинг, математика, рассуждения), это не мелочь.
Снапшоты состояния и агентные сценарии
Второй крупный блок изменений в MLX-движке касается агентных рабочих процессов. Проблема классическая: каждый вызов инструмента в агентном сценарии - это новый запрос, который переотправляет весь контекст заново. Системный промпт, определения инструментов, прочитанные файлы - все это обрабатывается снова и снова.
Ollama решила это через систему снапшотов состояния модели. Движок сохраняет состояние в точках, куда разговор с высокой вероятностью вернется: при ветвлении диалога, через интервалы в длинных промптах и перед каждым ответом. Это позволяет нескольким агентам работать параллельно, используя общий кэш для совпадающего контекста - системный промпт и определения инструментов обрабатываются единожды.
Отдельный сценарий - thinking-модели. Токены рассуждений генерируются, а потом выбрасываются из истории, что ломает стандартный prefix-кэш. Снапшот, сделанный прямо перед генерацией ответа, дает следующему запросу точку для возобновления без повторной обработки всего диалога.
Это та же технология, которую Ollama использует в своем облачном сервисе - теперь она работает локально на Mac.
Что меняется для пользователей в России
Ollama - полностью локальный инструмент с открытым исходным кодом. Никаких аккаунтов, подписок и API-ключей для локального запуска не требуется. Скачать можно с ollama.com или из репозитория на GitHub - оба ресурса доступны без VPN. Модели скачиваются с registry.ollama.ai, который тоже работает напрямую.
Обновиться до 0.40.0 можно, скачав новый установщик с сайта; на macOS и Windows обновление также может запуститься автоматически, на Linux - через повторный запуск установочного скрипта. Версия пока в статусе RC - команда тестирует и постепенно добавляет поддержку новых архитектур в MLX-раннер. Не все модели из библиотеки Ollama получат MLX по умолчанию сразу: в первую очередь это коснется архитектур, уже поддерживаемых раннером (Qwen3, Gemma 4 и ряд других).
Что это значит для экосистемы
Ollama с 182 тысячами звезд на GitHub - де-факто стандарт для запуска локальных LLM. Переход на MLX по умолчанию - это ставка на то, что Mac стал серьезной платформой для локального AI. MacBook Pro M4 Max с 128 ГБ памяти сегодня способен запускать 70-миллиардные модели с приемлемой скоростью - что год назад казалось уделом только рабочих станций.
LM Studio и Jan.ai, ближайшие конкуренты Ollama в сегменте десктопных лаунчеров, тоже поддерживают MLX, но Ollama выигрывает за счет экосистемы: интеграций с Open WebUI, Continue, Cursor и десятками других инструментов. Переключение MLX в режим по умолчанию без каких-либо действий со стороны пользователя - правильный шаг, который снижает порог входа для тех, кто не хочет разбираться в деталях.
Информация о релизе подтверждена несколькими публикациями и официальными источниками компании.
Источники
Похожие новости
OpenAI и Synopsys учат ИИ проектировать чипы вместе с инженерами
OpenAI и Synopsys запустили многолетнее партнерство и строят GPT-Synopsys - специализированную модель, которая умеет работать с EDA-инструментами и помогает инженерам оптимизировать дизайн полупроводников.
H Company выпустила Holo4: агент для компьютера за $0.08 за задачу
H Company открыла веса Holo4 - двух моделей для управления компьютером, которые набирают 85.2% на OSWorld и обходят GPT-5.5 по соотношению цены и результата.
Nvidia SoL-Pi режет расходы на токены кодящих агентов почти вдвое
Исследователи Nvidia научили систему SoL-Pi автоматически оптимизировать управляющий слой агентов - и получили минус 49% токенов без потери качества.