Ollama 0.33.0: встроенная интеграция с Claude и умный кэш для Apple Silicon
Тихий релиз с громкими последствиями
Ollama — тот проект, который методично и без лишнего шума делает локальный запуск языковых моделей доступным для всех. Версия 0.33.0 вышла 21 августа, и, судя по changelog, команда явно не скучала. Здесь нет революции в одном абзаце — зато есть несколько изменений, которые в совокупности сдвигают продукт в сторону полноценной платформы для ИИ-приложений. Расскажу, что именно изменилось и почему это важно.
Claude Desktop теперь живёт внутри Ollama
Самое неожиданное изменение — появление интеграции с Claude Desktop App прямо в интерфейсе Ollama. Разработчик ParthSareen добавил не просто упоминание Anthropic в документации, а полноценный опыт: управление моделями Claude через Ollama и новый раздел «Connect your apps experience».
Это интересный стратегический ход. Ollama традиционно ассоциировался с открытыми моделями — Llama, Mistral, Phi, Gemma. Включение Claude в экосистему означает, что платформа перестаёт быть исключительно «local-first» инструментом и начинает играть роль единой точки входа для работы с разными моделями — как локальными, так и облачными. По сути, Ollama примеряет на себя роль, которую LM Studio пытается занять уже несколько лет, но делает это через нативное приложение, а не только через API.
Для пользователей это означает следующее: вы можете переключаться между локальной Llama 3.1 и облачным Claude Sonnet в одном интерфейсе, не меняя рабочего окружения. Для разработчиков — унифицированный API, который работает независимо от того, где физически исполняется модель.
MLX-движок: серьёзная работа под капотом
Apple Silicon получил в этом релизе особое внимание. Команда закрыла несколько неприятных багов в MLX-бэкенде: исправлены некорректные предположения о Mac-окружении, которые ломали поведение MLX на Linux и Windows. Звучит как мелочь, но на деле это была источником трудноуловимых ошибок для всех, кто тестирует кросс-платформенные сборки.
Гораздо важнее другое изменение — улучшение механизма prefix cache в MLX Runner. Теперь точки восстановления кэша сохраняются даже при отменённых и возобновлённых prefill-операциях. Что это значит на практике? При длинных контекстах (а с современными моделями это нормальная ситуация — 32K, 64K, 128K токенов) система больше не выбрасывает уже вычисленный KV-кэш при прерывании запроса. Повторный запуск того же промпта будет существенно быстрее.
Для владельцев MacBook Pro M3/M4 с большим объёмом unified memory это практически означает более плавную работу с большими документами и длинными диалогами. Llama 3.1 70B на 64 ГБ памяти теперь будет менее болезненно реагировать на прерванные генерации.
Онбординг и интерфейс: мелочи, которые решают всё
Ollama также поработал над первым впечатлением от продукта. Обновлён layout экрана онбординга — выровнен, стал чище. Отключено масштабирование интерфейса (zoom), что устраняло визуальные артефакты на дисплеях с нестандартным DPI. Мелочь? Да. Но именно такие мелочи отличают инструмент разработчика от продукта, которым пользуются все.
Отдельно добавлен fallback на npx для DeepSeek Harness — это означает, что тестирование и запуск DeepSeek-моделей стало надёжнее в окружениях, где нет глобально установленных зависимостей. Для тех, кто активно экспериментирует с DeepSeek-V3 или R2, это устраняет один из раздражающих edge cases при первом запуске.
Контекст: где Ollama стоит среди конкурентов
На сегодня, август 2026, рынок локальных LLM-runner'ов выглядит примерно так: LM Studio делает ставку на графический интерфейс и удобство для нетехнических пользователей, Jan пытается быть open-source альтернативой с плагинами, llama.cpp остаётся движком для тех, кому нужен абсолютный контроль над каждым параметром.
Ollama занял нишу между llama.cpp и LM Studio: достаточно технический, чтобы его любили разработчики, но достаточно удобный для продуктивного использования без погружения в компиляцию флагов. 179 тысяч звёзд на GitHub и 17.5 тысяч форков говорят сами за себя — это не хайп, это реальное использование.
Интеграция с Claude Desktop App — это первый явный сигнал того, что Ollama хочет стать не просто runner'ом, а платформой. Если следующие версии добавят поддержку инструментов (tool use) и агентских фреймворков на уровне GUI, конкурировать с ними станет заметно сложнее.
Как это касается российских пользователей
Ollama работает полностью локально — никаких запросов к серверам, никаких ограничений по геолокации. Скачать дистрибутив можно напрямую с GitHub без VPN (хотя сам GitHub периодически замедляется). Что касается интеграции с Claude Desktop — здесь уже нужен аккаунт Anthropic, который для российских карт по-прежнему недоступен напрямую. Но для локальных моделей это абсолютно не важно: Ollama + Llama 3.1, Qwen 2.5 или Mistral работают без каких-либо внешних зависимостей.
Итог
Версия 0.33.0 — не революция, но очень уверенный шаг. Улучшенный MLX-кэш сделает Apple Silicon-пользователей счастливее, интеграция с Claude показывает амбиции платформы, а полировка онбординга говорит о том, что команда думает о росте аудитории за пределами core-разработчиков. Слежу за тем, когда появится стабильный релиз — пока это rc2, но судя по темпу изменений, финальная версия не за горами.
Источники
Похожие новости
Waymo создала собственный чип для роботакси и избавилась от зависимости от Nvidia
Alphabet разработала кастомный ASIC-чип мощностью 1000+ TOPS на техпроцессе TSMC 5 нм — теперь он стоит в каждом новом роботакси Waymo вместо железа от Nvidia и AMD.
NVIDIA AVO: агентная система достигла 100% на ARC-AGI-3
NVIDIA доказала: архитектура агента важнее самой модели. Система AVO подняла Claude Opus 5 с 30% до абсолютного результата на сложнейшем бенчмарке.
Ollama v0.32.15: кэш метаданных убирает лишние задержки
Ollama выпустила обновление v0.32.15 с кэшем метаданных моделей — теперь каждый запрос к локальному LLM обрабатывается быстрее без лишних накладных расходов.