Ollama 0.34.1: MLX из эксперимента стал стандартом

Тихий релиз с громкими последствиями
Ollama выпустила версию 0.34.1 14 сентября - без фанфар, одним коммитом в main. Но за этой скромной подачей скрываются изменения, которые реально меняют рабочий процесс для тех, кто собирает и запускает модели локально. Особенно для пользователей Apple Silicon.
MLX safetensors: эксперимент закончился
Самое показательное изменение - флаг "experimental" убрали с поддержки MLX safetensors при создании моделей через `ollama create`. Это означает, что теперь можно без опасений строить пайплайны на базе MLX и рассчитывать на стабильное поведение между версиями.
MLX - это фреймворк Apple для машинного обучения, заточенный под унифицированную память Apple Silicon. Когда Ollama добавляла его поддержку, статус "экспериментальный" был честным предупреждением: API мог поменяться, поведение - непредсказуемым. Теперь этого предупреждения нет. Для разработчиков, которые пишут скрипты автоматизации или строят продукты поверх Ollama на маках - это конкретная точка опоры.
Параллельно улучшили управление памятью MLX на Apple Silicon. Детали в release notes минимальны, но судя по контексту - речь о более аккуратном освобождении памяти при переключении между моделями. На M-чипах с объединенной памятью это критично: там нет отдельного GPU VRAM, и модели конкурируют за один пул с операционной системой.
GGUF: правила ужесточились
Здесь изменение, которое потребует действий от части пользователей. Создание GGUF-моделей теперь обязательно требует использования инструментов llama.cpp - конкретно для конвертации из safetensors и квантизации. Раньше Ollama брала часть этой работы на себя внутри.
Почему так сделали? Логика понятна: llama.cpp развивается быстро, поддерживает все больше архитектур и форматов квантизации. Держать дублирующую логику внутри Ollama - это постоянный технический долг. Отдав эту ответственность специализированному инструменту, команда снимает с себя головную боль совместимости.
Практически это означает: если вы раньше делали `ollama create` прямо из папки с safetensors без предварительной конвертации - теперь нужен дополнительный шаг через `convert_hf_to_gguf.py` из репозитория llama.cpp. Это не катастрофа, но об этом нужно знать заранее, а не обнаруживать в продакшне.
Детектор повторяющихся токенов стал терпимее
Интересная правка в логике защиты от зацикливания. Раньше детектор runaway repeat tokens срабатывал при меньшем количестве повторений - теперь порог поднят до 100 токенов. Изменение сделали специально для снижения ложных срабатываний на задачах вроде OCR.
Это хорошо иллюстрирует компромисс, с которым постоянно сталкиваются разработчики inference-движков. Слишком чувствительный детектор обрывает нормальную работу модели на структурированных выходных данных - таблицах, коде, OCR-результатах, где повторение паттернов является нормой. Слишком терпимый - позволяет модели уйти в бесконечный цикл. Судя по жалобам сообщества, предыдущий порог был слишком низким.
API /api/tags ускорился в десять раз
Цифра, которая сразу бросается в глаза: время холодного ответа `/api/tags` сократилось с 3,1 секунды до 294 миллисекунд. Это примерно десятикратное ускорение на больших библиотеках моделей.
Для тех, кто держит локально десятки моделей и строит поверх Ollama интерфейсы или автоматизацию - это ощутимо. Open WebUI, Enchanted, собственные скрипты - все, что при запуске опрашивает список доступных моделей, теперь делает это намного быстрее. Заодно починили консистентность в отображении возможностей моделей - раньше поле capabilities могло вести себя непоследовательно.
typical_p отправился на пенсию
Параметр `typical_p` официально deprecated. Создавать новые модели с ним больше нельзя - Ollama его игнорирует. Старые GGUF-модели, в которых он прописан, продолжат работать для обратной совместимости, но рассчитывать на него в новых проектах не стоит.
`typical_p` - это метод семплирования, альтернативный top-p, основанный на концепции "типичности" токена относительно энтропии распределения. На практике он использовался редко и давал непредсказуемые результаты на современных моделях. Его уход - логичная уборка.
Что это значит на практике
Ollama сейчас - де-факто стандарт для локального запуска LLM на потребительском железе. 181 тысяча звезд на GitHub и 17,9 тысячи форков - это не просто популярность, это экосистема. Каждое изменение в релизе прямо затрагивает тысячи рабочих установок.
Версия 0.34.1 не революция - это зрелая шлифовка. MLX-путь стабилизирован, GGUF-путь стал чище за счет делегирования специализированному инструменту, API стал быстрее, детектор зависаний - умнее.
Для российских пользователей: Ollama работает без VPN, это open source проект, который скачивается с GitHub и hub.docker.com. Сами модели тянутся с ollama.com - там тоже без ограничений. Установка стандартная: `curl -fsSL https://ollama.com/install.sh | sh` на Linux, DMG-пакет на macOS.
Обновиться стоит - особенно если вы на Apple Silicon и активно работаете с MLX-моделями.
Источники
Похожие новости
Crusoe привлек $3,9 млрд: заводские ИИ-фабрики против гигантских дата-центров
Денверская компания Crusoe закрыла раунд Series F на $3,9 млрд, оценив себя в $30,9 млрд - втрое дороже, чем год назад. Деньги пойдут на модульные ИИ-фабрики Spark и мегакампусы в Техасе.
Claude Code перезапустил Projects: несколько агентов в облаке под одной крышей
Anthropic обновила Projects в Claude Code: теперь команда агентов работает параллельно, делит память и файлы, а координатор следит за порядком.
GitHub переписал движок Copilot на Rust с помощью самого Copilot
GitHub перевел runtime Copilot CLI на нативный Rust, задействовав агентов Copilot для миграции 800 000 строк кода - масштаб, который раньше был просто нерентабелен.