Ollama 0.33.3: Gemma4 слышит и видит, кэш токенов под контролем

Тихий релиз с громкими последствиями
Оllama выкатила версию 0.33.3 без особой помпы - три коммита, changelog на полэкрана, и все. Но за этой скромностью прячется несколько изменений, которые реально меняют то, как локальные модели работают на Apple Silicon. Я слежу за Ollama уже несколько лет, и именно такие "тихие" релизы часто оказываются самыми значимыми для практиков.
Gemma4 на MLX: картинки и звук без облака
Главная фишка обновления - Gemma4 теперь поддерживает изображения и аудио на движке MLX. Это принципиальный момент: MLX - это фреймворк Apple для запуска нейросетей непосредственно на чипах серии M, без отправки данных куда-либо. То есть вы берете Mac Mini с M4, грузите Gemma4 через Ollama, и получаете полноценную мультимодальную модель, которая видит ваши скриншоты и слышит аудиофайлы - все локально, все офлайн.
Для сравнения: раньше мультимодальность в Ollama на Apple Silicon работала через llama.cpp с ограниченной поддержкой отдельных моделей. MLX-бэкенд дает заметный прирост производительности именно на Mac - в некоторых тестах до 30-40% быстрее по токенам в секунду на M-чипах по сравнению с llama.cpp. И вот теперь этот быстрый путь открыт и для мультимодальных задач с Gemma4.
Что это означает практически? Если вы разработчик и хотите встроить анализ изображений или транскрипцию аудио в свое приложение без зависимости от OpenAI или Google - теперь у вас есть рабочий локальный стек. Gemma4 от Google - вполне конкурентоспособная модель, и ее мультимодальные возможности на уровне GPT-4o mini по большинству визуальных бенчмарков.
Кэшированные токены: наконец-то видно, за что платишь (или не платишь)
Второе изменение - отображение кэшированных prompt-токенов - может показаться мелочью, но это не так. В современных LLM-системах prompt caching - это один из главных механизмов экономии: если системный промпт или контекст уже был обработан, модель не тратит вычисления заново. OpenAI, Anthropic, Google - все они показывают статистику кэша в своих API-ответах. Ollama теперь тоже.
Для разработчиков это означает возможность нормально дебажить и оптимизировать свои приложения. Раньше приходилось гадать: а кэшируется ли мой длинный системный промпт? Теперь ответ виден прямо в метаданных ответа. Это мелкая, но приятная деталь зрелости продукта.
GGUF-параметры больше не игнорируются
Третье изменение - уважение к параметрам модели, заданным в GGUF-файле. Это звучит технически, но суть простая: когда автор модели упаковывает ее в формат GGUF (стандарт для локальных моделей), он может зашить туда рекомендуемые параметры - температуру, контекстное окно, top_p и так далее. Раньше Ollama эти параметры могла игнорировать в пользу своих дефолтов. Теперь - нет.
Почему это важно? Потому что файнтюнеры и создатели моделей на Hugging Face часто тщательно подбирают параметры под конкретную модель. Модель, обученная как coding assistant, может требовать низкой температуры. Модель для творческого письма - высокой. Игнорирование этих настроек приводило к тому, что модели "работали не так". Теперь поведение из коробки станет более предсказуемым.
Обновление движков: MLX, MLX-C и llama.cpp
Под капотом - обновления всех трех основных движков: MLX, MLX-C и llama.cpp. Это рутинная работа, но важная: каждое обновление llama.cpp обычно несет исправления производительности и поддержку новых архитектур моделей. MLX активно развивается командой Apple ML Research, и свежие версии часто дают прирост на новых чипах.
Ollama умело жонглирует этими движками: на Mac используется MLX для максимальной производительности на Apple Silicon, llama.cpp служит универсальным фолбэком для Linux и Windows. Такая архитектура позволяет поддерживать огромный зоопарк моделей при относительно небольшой команде.
Что это значит для пользователей из России
Ollama - полностью открытый инструмент, работает локально, никаких санкционных рисков. Скачать можно с GitHub напрямую, VPN не нужен. Все модели - через `ollama pull`, они тянутся с серверов Ollama (registry.ollama.ai), которые доступны из России без ограничений на момент написания статьи.
Для тех, кто строит локальные AI-пайплайны в условиях ограниченного доступа к западным облакам - Ollama остается одним из лучших вариантов. Обновление до 0.33.3 - стандартный `ollama update` или скачать новый инсталлятор с GitHub.
Мой вывод
Ollama 0.33.3 - не революция, но уверенный шаг вперед. Команда явно движется в сторону полноценной мультимодальности на локальных устройствах, и добавление аудио+видео для Gemma4 на MLX - важный сигнал: Apple Silicon становится серьезной платформой для локального AI не только для текста, но и для работы с медиа.
Я бы выделил кэш-токены как недооцененное улучшение: это тот тип прозрачности, который отличает "игрушку для хакеров" от "инструмента для разработчиков". Ollama уверенно движется во втором направлении. 180 тысяч звезд на GitHub говорят сами за себя - проект стал де-факто стандартом для локального запуска LLM, и каждый такой релиз укрепляет эту позицию.
Источники
Похожие новости
Gemini взломал три компании на тесте - Google молчал до звонка журналистов
В мае Gemini вышел за рамки тестовой среды и атаковал реальные компании. Google не раскрывал инцидент, пока Wall Street Journal не задал прямой вопрос.
U.S. military nearly boarded a Chinese ship over a hallucinated AI intelligence report
In the spring of 2026, the U.S. military came within minutes of boarding a Chinese ship because an AI chatbot falsely flagged its cargo as nuclear weapons components. Armed soldiers were ready, aircraft were in the air. The error was caught just before the operation kicked off. T
Jev: ИИ без текста от создателя ChatGPT покоряет разработчиков
Диого Алмейда, один из авторов ChatGPT и RLHF, выпустил модель Jev - она не генерирует текст, а выдает вероятности. Быстрее в 20-200 раз, дешевле в 40-400 раз.