EmbeddingGemma 2: Google выпустила компактную мультимодальную модель для локального запуска

Когда компания выпускает очередную "компактную" модель, первый вопрос обычно один: насколько компактную? В случае с EmbeddingGemma 2 Google дает конкретный ответ - около 191 МБ оперативной памяти. При этом полная мультимодальная конфигурация на 740 млн параметров умеет работать с текстом, изображениями, видео, аудио и кодом - а для задач только с текстом есть облегченная версия на 270 млн параметров.
Что умеет и как работает
EmbeddingGemma 2 - это не генеративная модель в привычном смысле. Она не пишет тексты и не рисует картинки. Ее задача - конвертировать любой контент в числовые векторы, чтобы потом находить семантически близкие фрагменты. Это основа для RAG-систем, семантического поиска, рекомендаций и классификации.
Главное отличие от предыдущего поколения - мультимодальность. Теперь можно, например, найти нужный видеофрагмент по голосовому запросу или искать по аудиозаписям через текстовый запрос. Google прямо указывает на такие сценарии как целевые. Это переводит модель из чисто текстового инструмента в нечто более универсальное.
Цифры, которые сложно игнорировать
На бенчмарке MTEB Code (Massive Text Embedding Benchmark) EmbeddingGemma 2 набирает 78.68 балла. Предыдущая версия показывала 68.76 - прирост почти в 10 пунктов. Это серьезный скачок, а не косметическое улучшение.
Google утверждает, что модель обходит конкурентов с вдвое большим числом параметров на мультимодальных бенчмарках. Проверить это утверждение независимо пока сложно - сравнительные тесты от сторонних исследователей появятся позже.
Еще одна практически важная цифра: модель сокращает объем хранилища для локальных векторных баз данных до 6 раз. Для edge-устройств с ограниченным накопителем это не мелочь.
Локальный запуск и браузер
Модель работает без API-ключа. Запрос через WebGPU в браузере занимает 20-70 миллисекунд - вполне приемлемо для интерактивных приложений. Веса доступны на Hugging Face и Kaggle, там же лежит документация и руководство для разработчиков.
В связке с небольшими открытыми моделями - Google приводит в пример Gemma 4 - EmbeddingGemma 2 позволяет строить полноценные RAG-приложения, которые работают полностью офлайн. Никакие данные не уходят на внешние серверы. Для корпоративных сценариев с чувствительными данными это принципиальный момент.
Что это значит для рынка
Разработчики и компании, работающие с ограниченной инфраструктурой или строящие приватные решения, получают рабочий инструмент без зависимости от облачных API. Модель доступна на Hugging Face - то есть скачать и запустить можно без каких-либо аккаунтов Google и без привязки карты. VPN для загрузки весов в большинстве случаев не нужен, хотя доступность Kaggle из России стоит проверять отдельно.
На рынке эмбеддинговых моделей сейчас несколько сильных игроков: Cohere Embed, OpenAI text-embedding-3-large, Voyage AI. Все они работают через API и требуют передачи данных в облако. EmbeddingGemma 2 занимает другую нишу - локальный запуск с конкурентоспособным качеством. Это не прямая конкуренция, а другой рынок.
Если мультимодальные возможности окажутся действительно рабочими, а не маркетинговым тезисом, это открывает целый класс приложений: локальный поиск по медиатеке, приватный семантический поиск по документам, офлайн-ассистенты с памятью.
Открытый вопрос
Пока неясно, насколько хорошо мультимодальные эмбеддинги работают на реальных данных вне синтетических бенчмарков. Сценарий "найти видео по голосовому запросу" красиво звучит в пресс-релизе, но качество такого поиска сильно зависит от обучающих данных и конкретного домена. Первые независимые тесты от сообщества появятся в ближайшие недели - вот тогда и станет понятно, насколько заявленные преимущества перед более крупными моделями держатся вне Google-бенчмарков.
Информация о выходе модели подтверждена несколькими независимыми публикациями.
Источники
Похожие новости
Reflection выпустила Beam: открытая модель с 501 млрд параметров за треть цены
Стартап Reflection представил Beam - открытую MoE-модель на 501 млрд параметров, которая при активных 23 млрд соперничает с китайскими флагманами и тратит в 3-4 раза меньше вычислений. Показатели компании независимо не проверены.
Reflection AI выпустила Beam: 501 млрд параметров против китайских моделей
Стартап из Бруклина с оценкой $25 млрд представил первую открытую модель Beam - MoE на 501B параметров, которая претендует на эффективность GLM-5.2 при втрое меньших вычислительных затратах. Ключевые бенчмарки пока не прошли независимую проверку.
DeepSeek Harness v0.2: десктоп, плагины и планировщик задач без командной строки
DeepSeek выпустил v0.2 своего агентного фреймворка с нативными приложениями для macOS и Windows, встроенным менеджером плагинов и планировщиком задач на базе session-local механизма.