G
ИИ-чатEmbeddingGemma 2Google DeepMindмультимодальные эмбеддингиon-device AIRAG

Google выпустила EmbeddingGemma 2: мультимодальный поиск прямо на телефоне

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
Google выпустила EmbeddingGemma 2: мультимодальный поиск прямо на телефоне

Первая EmbeddingGemma вышла в 2025 году как скромный инструмент для текстовых эмбеддингов на потребительском железе. Разработчики скачали ее более 20 миллионов раз - Google DeepMind сам признал, что такой отклик превзошел все ожидания. Теперь компания делает следующий шаг: EmbeddingGemma 2 умеет работать не только с текстом, но и с кодом, изображениями, видео и аудио - и все это в едином векторном пространстве, без отправки данных куда-либо.

Что внутри

Модель построена на архитектуре Gemma 4 и содержит 740 миллионов параметров, но эта цифра немного обманчива. На деле архитектура модульная: текстовое ядро занимает 270 млн параметров, к нему опционально добавляется визуальный энкодер на 170 млн и аудиоэнкодер на 300 млн. Разработчик загружает только то, что нужно его задаче. Все три компонента проецируют входные данные в одно 768-мерное пространство, поэтому голосовой запрос и видеофрагмент можно сравнивать напрямую.

Контекстное окно выросло до 8192 токенов - в четыре раза больше, чем у первой версии. Каждая модальность "потребляет" токены по фиксированной ставке: изображение занимает 280 токенов, кадр видео - 140, одна секунда аудио - 25. Итого в один запрос влезает до 29 изображений, 58 видеокадров или 5,5 минут аудио - или их произвольное сочетание.

Память и хранилище

На Google Pixel 11 Pro с квантизацией текстовая версия занимает около 191 МБ оперативной памяти, полная мультимодальная - 567 МБ. Для смартфона 2026 года это вполне рабочие цифры.

С векторами отдельная история. Каждый эмбеддинг по умолчанию - список из 768 чисел. Миллион таких векторов в bfloat16 занимает около 1,5 ГБ. Техника Matryoshka Representation Learning (MRL) позволяет усечь размерность до 512, 256 или 128 - хранилище при этом сжимается до шести раз. Согласно руководству для разработчиков, 256-мерные векторы сохраняют около 95% качества на изображениях, видео и речи. 128 измерений держат примерно 90% качества для текста и кода, но на мультимодальных задачах качество падает до ~75% - это честное предупреждение, которое Google не прячет.

Бенчмарки

Самый заметный прирост - в коде: MTEB Code вырос с 68,76 до 78,68, то есть на 9,92 пункта. Для разработчиков, которые строят семантический поиск по кодовой базе или retrieval для coding-агентов, это существенно.

По мультиязычному тексту (MTEB multilingual v2) модель набирает 61,36, по визуальным документам - 67,84, по видеопоиску - 50,67, по аудиозадачам MAEB - 49,39. Google заявляет лидерство среди мультимодальных моделей до 1 млрд параметров и утверждает, что EmbeddingGemma 2 превосходит некоторые специализированные модели вдвое большего размера.

Многоязычный текст практически не изменился по сравнению с первой версией - здесь прогресс минимальный. Модель поддерживает более 100 языков, но Google прямо предупреждает: качество по ним неодинаковое.

Честность насчет безопасности

Модель не проходила safety-тюнинг и не имеет модерации выходных данных. Google применял защитные меры на уровне обучающих данных. Это стандартная практика для открытых embedding-моделей, но важно понимать: если вы строите на ней продукт, фильтрацию придется добавлять самостоятельно.

Интеграция и экосистема

В сочетании с генеративными моделями вроде Gemma 4 EmbeddingGemma 2 позволяет строить RAG-пайплайны полностью на устройстве. В демо-приложении AI Edge Gallery есть функция Video Moments Finder - поиск момента в видео по текстовому или голосовому запросу. Google также использует EmbeddingGemma 2 в приложении AI Edge Foresight.

Веса доступны на Hugging Face и Kaggle прямо сейчас. Модель работает с открытыми инструментами: vLLM, llama.cpp, Ollama. В Model Garden на Gemini Enterprise Agent Platform появится позже.

Лицензия Apache 2.0 допускает коммерческое использование, однако на модель также распространяется Gemma Prohibited Use Policy - перед использованием в продукте стоит с ней ознакомиться.

Что это значит для разработчиков

RAG-пайплайн без сетевых запросов - давняя мечта тех, кто работает с чувствительными данными. Медицинские записи, юридические документы, корпоративные кодовые базы - все это теперь можно индексировать и искать локально, без облака. 567 МБ для полной мультимодальной модели - цена вполне подъемная даже для мобильного приложения.

Для российских разработчиков: веса опубликованы на Hugging Face, весят разумно, работают офлайн. VPN для скачивания может понадобиться в зависимости от провайдера, но сама модель после загрузки работает автономно.

Конкуренты в этом сегменте - CLIP-подобные модели и открытые варианты вроде nomic-embed-multimodal. EmbeddingGemma 2 выигрывает за счет нативной поддержки аудио (большинство конкурентов его не умеют), модульности и оптимизации под мобильное железо.

Главный вопрос, который остается открытым: насколько хорошо модель справляется с русским языком в аудио и визуальных задачах. Google говорит про 100+ языков, но детализации по конкретным языкам в открытых материалах нет. Это придется проверять на практике.

Информация подтверждена несколькими независимыми публикациями.

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости