Ollama
ИИ-чатOllamaGemma4MLXлокальные LLMGGUF

Ollama 0.33.3: Gemma4 слышит и видит, кэш токенов под контролем

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
Ollama 0.33.3: Gemma4 слышит и видит, кэш токенов под контролем

Тихий релиз с громкими последствиями

Оllama выкатила версию 0.33.3 без особой помпы - три коммита, changelog на полэкрана, и все. Но за этой скромностью прячется несколько изменений, которые реально меняют то, как локальные модели работают на Apple Silicon. Я слежу за Ollama уже несколько лет, и именно такие "тихие" релизы часто оказываются самыми значимыми для практиков.

Gemma4 на MLX: картинки и звук без облака

Главная фишка обновления - Gemma4 теперь поддерживает изображения и аудио на движке MLX. Это принципиальный момент: MLX - это фреймворк Apple для запуска нейросетей непосредственно на чипах серии M, без отправки данных куда-либо. То есть вы берете Mac Mini с M4, грузите Gemma4 через Ollama, и получаете полноценную мультимодальную модель, которая видит ваши скриншоты и слышит аудиофайлы - все локально, все офлайн.

Для сравнения: раньше мультимодальность в Ollama на Apple Silicon работала через llama.cpp с ограниченной поддержкой отдельных моделей. MLX-бэкенд дает заметный прирост производительности именно на Mac - в некоторых тестах до 30-40% быстрее по токенам в секунду на M-чипах по сравнению с llama.cpp. И вот теперь этот быстрый путь открыт и для мультимодальных задач с Gemma4.

Что это означает практически? Если вы разработчик и хотите встроить анализ изображений или транскрипцию аудио в свое приложение без зависимости от OpenAI или Google - теперь у вас есть рабочий локальный стек. Gemma4 от Google - вполне конкурентоспособная модель, и ее мультимодальные возможности на уровне GPT-4o mini по большинству визуальных бенчмарков.

Кэшированные токены: наконец-то видно, за что платишь (или не платишь)

Второе изменение - отображение кэшированных prompt-токенов - может показаться мелочью, но это не так. В современных LLM-системах prompt caching - это один из главных механизмов экономии: если системный промпт или контекст уже был обработан, модель не тратит вычисления заново. OpenAI, Anthropic, Google - все они показывают статистику кэша в своих API-ответах. Ollama теперь тоже.

Для разработчиков это означает возможность нормально дебажить и оптимизировать свои приложения. Раньше приходилось гадать: а кэшируется ли мой длинный системный промпт? Теперь ответ виден прямо в метаданных ответа. Это мелкая, но приятная деталь зрелости продукта.

GGUF-параметры больше не игнорируются

Третье изменение - уважение к параметрам модели, заданным в GGUF-файле. Это звучит технически, но суть простая: когда автор модели упаковывает ее в формат GGUF (стандарт для локальных моделей), он может зашить туда рекомендуемые параметры - температуру, контекстное окно, top_p и так далее. Раньше Ollama эти параметры могла игнорировать в пользу своих дефолтов. Теперь - нет.

Почему это важно? Потому что файнтюнеры и создатели моделей на Hugging Face часто тщательно подбирают параметры под конкретную модель. Модель, обученная как coding assistant, может требовать низкой температуры. Модель для творческого письма - высокой. Игнорирование этих настроек приводило к тому, что модели "работали не так". Теперь поведение из коробки станет более предсказуемым.

Обновление движков: MLX, MLX-C и llama.cpp

Под капотом - обновления всех трех основных движков: MLX, MLX-C и llama.cpp. Это рутинная работа, но важная: каждое обновление llama.cpp обычно несет исправления производительности и поддержку новых архитектур моделей. MLX активно развивается командой Apple ML Research, и свежие версии часто дают прирост на новых чипах.

Ollama умело жонглирует этими движками: на Mac используется MLX для максимальной производительности на Apple Silicon, llama.cpp служит универсальным фолбэком для Linux и Windows. Такая архитектура позволяет поддерживать огромный зоопарк моделей при относительно небольшой команде.

Что это значит для пользователей из России

Ollama - полностью открытый инструмент, работает локально, никаких санкционных рисков. Скачать можно с GitHub напрямую, VPN не нужен. Все модели - через `ollama pull`, они тянутся с серверов Ollama (registry.ollama.ai), которые доступны из России без ограничений на момент написания статьи.

Для тех, кто строит локальные AI-пайплайны в условиях ограниченного доступа к западным облакам - Ollama остается одним из лучших вариантов. Обновление до 0.33.3 - стандартный `ollama update` или скачать новый инсталлятор с GitHub.

Мой вывод

Ollama 0.33.3 - не революция, но уверенный шаг вперед. Команда явно движется в сторону полноценной мультимодальности на локальных устройствах, и добавление аудио+видео для Gemma4 на MLX - важный сигнал: Apple Silicon становится серьезной платформой для локального AI не только для текста, но и для работы с медиа.

Я бы выделил кэш-токены как недооцененное улучшение: это тот тип прозрачности, который отличает "игрушку для хакеров" от "инструмента для разработчиков". Ollama уверенно движется во втором направлении. 180 тысяч звезд на GitHub говорят сами за себя - проект стал де-факто стандартом для локального запуска LLM, и каждый такой релиз укрепляет эту позицию.

Источники

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости