Ollama
Генерация кодаOllamaGemma 4MLXлокальные моделиApple Silicon

Ollama v0.32.1: Gemma 4 стала умнее, а утечка памяти MLX закрыта

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
Ollama v0.32.1: Gemma 4 стала умнее, а утечка памяти MLX закрыта

Тихий патч с громкими последствиями

Когда выходит релиз с номером вроде v0.32.1, большинство пользователей его игнорируют — ну, патч и патч. Но в случае с Ollama это было бы ошибкой. Команда упаковала в этот «маленький» релиз несколько исправлений, которые напрямую бьют по болевым точкам разработчиков, работающих с локальными моделями на Apple Silicon. Релиз вышел 16 июля 2026 года — буквально через пять дней после v0.32.0, что само по себе говорит об оперативности команды.

Gemma 4 наконец нормально звонит инструментам

Главная история этого обновления — улучшенный tool calling для Gemma 4 и многоходовое рассуждение (multi-turn reasoning). Конкретно: теперь надёжнее работают продолжения после ответа инструмента (tool-response continuations). Для тех, кто строит агентные пайплайны — это критично. Раньше модель могла «забыть» контекст предыдущего вызова инструмента и начать генерировать мусор. Теперь цепочка рассуждений держится крепче.

Gemma 4 от Google — одна из лучших мультимодальных моделей в своём весовом классе. Версия E4B работает всего в ~6 ГБ видеопамяти, что делает её доступной на большинстве потребительских видеокарт. При этом модель поддерживает vision и tool calling одновременно — редкое сочетание для такого размера. Ещё в июньском обновлении MLX ускорило генерацию токенов на Apple Silicon почти на 90% за счёт нового батч-матмул ядра. Теперь к этому добавилась стабильность агентных сценариев.

Утечка памяти MLX: наконец-то закрыта

Вторая важная правка — исправление рекуррентной утечки кэша MLX-моделей. Это была неприятная проблема: при каждом запросе память потихоньку накапливалась, и после нескольких часов работы сервер начинал тормозить или вовсе падать. Для тех, кто держит Ollama как постоянный локальный сервис на Mac, это было настоящей головной болью.

Помимо закрытия утечки, улучшена производительность снимков кэша (cache snapshot performance) — что должно заметно сказаться на скорости переключения между моделями. Также теперь загрузка текстовых MLX-моделей корректно уважает переменную окружения `OLLAMA_LOAD_TIMEOUT` — раньше таймаут просто игнорировался, и модель могла грузиться сколь угодно долго.

Агентный режим стал чуть умнее

V0.32.0 представил интерактивный агентный режим «Chat, Code & Work» — амбициозная попытка превратить Ollama из простого инструмента запуска моделей в полноценного локального ассистента. В v0.32.1 этот режим получил два точечных улучшения.

Первое: агент теперь передаёт текущую рабочую директорию в контекст, что критично для проектно-ориентированной работы. Раньше агент понятия не имел, в каком проекте вы находитесь. Второе: веб-поиск и fetch в агентном режиме теперь явно подсказывают пользователю запустить `ollama signin`, если требуется аутентификация — вместо загадочных ошибок.

Также поправлен баг с командой `ollama launch`: если модель помечена как устаревшая и передана через флаг `--model`, теперь корректно открывается пикер выбора модели. Мелочь, но раздражала.

Контекст: куда движется Ollama в июле 2026-го

За последние полтора месяца Ollama прошла путь от v0.30.11 до v0.32.1 — это шесть значимых релизов за семь недель. Темп разработки впечатляет. Каждый релиз закрывал что-то важное: flash attention для старых NVIDIA GPU, структурированный вывод для thinking-моделей, автоустановка Claude Code и opencode.

Экосистема моделей при этом растёт не менее стремительно. Сейчас библиотека Ollama содержит несколько сотен курируемых моделей. Лучшие варианты на сегодня: Qwen 3.6 27B (77,2% SWE-bench, помещается в 24 ГБ при Q4-квантизации) для общих задач, Kimi K2.6 с 80,2% SWE-bench Verified для серьёзного кодинга, DeepSeek V4 Pro с 93,5% LiveCodeBench для алгоритмических задач. Для тех, кому нужна модель на 16 ГБ — gpt-oss:20b от OpenAI работает на уровне o3-mini с регулируемым reasoning.

Что это значит для российских пользователей

Ollama по-прежнему полностью бесплатна и работает без API-ключей и подписок. Всё крутится локально — никаких серверов, никакой передачи данных. Для российских пользователей это принципиально: VPN не нужен, карта не нужна, санкции не причём. Единственное ограничение — железо. Для комфортной работы с моделями вроде Gemma 4 E4B или Qwen 3.6 27B нужна видеокарта с минимум 8-24 ГБ VRAM или Mac с унифицированной памятью от 16 ГБ.

Обновиться до v0.32.1 можно стандартным способом: `curl https://ollama.ai/install.sh | sh` на Linux, `brew upgrade ollama` на Mac. Версию можно проверить командой `ollama --version`.

Итог

v0.32.1 — классический «тихий патч с реальной пользой». Если вы используете Gemma 4 в агентных сценариях или держите Ollama как постоянный сервис на Apple Silicon — обновление обязательно. Утечка памяти MLX и нестабильный tool calling были достаточно неприятными проблемами, чтобы их исправление заслуживало немедленного апдейта. Информация о релизе подтверждена несколькими независимыми публикациями.

Все эти инструменты — уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости