Ollama
Генерация кодаOllamaMLXGGUFApple Siliconлокальные модели

Ollama 0.34.1: MLX из эксперимента стал стандартом

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
Ollama 0.34.1: MLX из эксперимента стал стандартом

Тихий релиз с громкими последствиями

Ollama выпустила версию 0.34.1 14 сентября - без фанфар, одним коммитом в main. Но за этой скромной подачей скрываются изменения, которые реально меняют рабочий процесс для тех, кто собирает и запускает модели локально. Особенно для пользователей Apple Silicon.

MLX safetensors: эксперимент закончился

Самое показательное изменение - флаг "experimental" убрали с поддержки MLX safetensors при создании моделей через `ollama create`. Это означает, что теперь можно без опасений строить пайплайны на базе MLX и рассчитывать на стабильное поведение между версиями.

MLX - это фреймворк Apple для машинного обучения, заточенный под унифицированную память Apple Silicon. Когда Ollama добавляла его поддержку, статус "экспериментальный" был честным предупреждением: API мог поменяться, поведение - непредсказуемым. Теперь этого предупреждения нет. Для разработчиков, которые пишут скрипты автоматизации или строят продукты поверх Ollama на маках - это конкретная точка опоры.

Параллельно улучшили управление памятью MLX на Apple Silicon. Детали в release notes минимальны, но судя по контексту - речь о более аккуратном освобождении памяти при переключении между моделями. На M-чипах с объединенной памятью это критично: там нет отдельного GPU VRAM, и модели конкурируют за один пул с операционной системой.

GGUF: правила ужесточились

Здесь изменение, которое потребует действий от части пользователей. Создание GGUF-моделей теперь обязательно требует использования инструментов llama.cpp - конкретно для конвертации из safetensors и квантизации. Раньше Ollama брала часть этой работы на себя внутри.

Почему так сделали? Логика понятна: llama.cpp развивается быстро, поддерживает все больше архитектур и форматов квантизации. Держать дублирующую логику внутри Ollama - это постоянный технический долг. Отдав эту ответственность специализированному инструменту, команда снимает с себя головную боль совместимости.

Практически это означает: если вы раньше делали `ollama create` прямо из папки с safetensors без предварительной конвертации - теперь нужен дополнительный шаг через `convert_hf_to_gguf.py` из репозитория llama.cpp. Это не катастрофа, но об этом нужно знать заранее, а не обнаруживать в продакшне.

Детектор повторяющихся токенов стал терпимее

Интересная правка в логике защиты от зацикливания. Раньше детектор runaway repeat tokens срабатывал при меньшем количестве повторений - теперь порог поднят до 100 токенов. Изменение сделали специально для снижения ложных срабатываний на задачах вроде OCR.

Это хорошо иллюстрирует компромисс, с которым постоянно сталкиваются разработчики inference-движков. Слишком чувствительный детектор обрывает нормальную работу модели на структурированных выходных данных - таблицах, коде, OCR-результатах, где повторение паттернов является нормой. Слишком терпимый - позволяет модели уйти в бесконечный цикл. Судя по жалобам сообщества, предыдущий порог был слишком низким.

API /api/tags ускорился в десять раз

Цифра, которая сразу бросается в глаза: время холодного ответа `/api/tags` сократилось с 3,1 секунды до 294 миллисекунд. Это примерно десятикратное ускорение на больших библиотеках моделей.

Для тех, кто держит локально десятки моделей и строит поверх Ollama интерфейсы или автоматизацию - это ощутимо. Open WebUI, Enchanted, собственные скрипты - все, что при запуске опрашивает список доступных моделей, теперь делает это намного быстрее. Заодно починили консистентность в отображении возможностей моделей - раньше поле capabilities могло вести себя непоследовательно.

typical_p отправился на пенсию

Параметр `typical_p` официально deprecated. Создавать новые модели с ним больше нельзя - Ollama его игнорирует. Старые GGUF-модели, в которых он прописан, продолжат работать для обратной совместимости, но рассчитывать на него в новых проектах не стоит.

`typical_p` - это метод семплирования, альтернативный top-p, основанный на концепции "типичности" токена относительно энтропии распределения. На практике он использовался редко и давал непредсказуемые результаты на современных моделях. Его уход - логичная уборка.

Что это значит на практике

Ollama сейчас - де-факто стандарт для локального запуска LLM на потребительском железе. 181 тысяча звезд на GitHub и 17,9 тысячи форков - это не просто популярность, это экосистема. Каждое изменение в релизе прямо затрагивает тысячи рабочих установок.

Версия 0.34.1 не революция - это зрелая шлифовка. MLX-путь стабилизирован, GGUF-путь стал чище за счет делегирования специализированному инструменту, API стал быстрее, детектор зависаний - умнее.

Для российских пользователей: Ollama работает без VPN, это open source проект, который скачивается с GitHub и hub.docker.com. Сами модели тянутся с ollama.com - там тоже без ограничений. Установка стандартная: `curl -fsSL https://ollama.com/install.sh | sh` на Linux, DMG-пакет на macOS.

Обновиться стоит - особенно если вы на Apple Silicon и активно работаете с MLX-моделями.

Источники

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости