Google выпустила EmbeddingGemma 2: мультимодальный поиск прямо на телефоне

Первая EmbeddingGemma вышла в 2025 году как скромный инструмент для текстовых эмбеддингов на потребительском железе. Разработчики скачали ее более 20 миллионов раз - Google DeepMind сам признал, что такой отклик превзошел все ожидания. Теперь компания делает следующий шаг: EmbeddingGemma 2 умеет работать не только с текстом, но и с кодом, изображениями, видео и аудио - и все это в едином векторном пространстве, без отправки данных куда-либо.
Что внутри
Модель построена на архитектуре Gemma 4 и содержит 740 миллионов параметров, но эта цифра немного обманчива. На деле архитектура модульная: текстовое ядро занимает 270 млн параметров, к нему опционально добавляется визуальный энкодер на 170 млн и аудиоэнкодер на 300 млн. Разработчик загружает только то, что нужно его задаче. Все три компонента проецируют входные данные в одно 768-мерное пространство, поэтому голосовой запрос и видеофрагмент можно сравнивать напрямую.
Контекстное окно выросло до 8192 токенов - в четыре раза больше, чем у первой версии. Каждая модальность "потребляет" токены по фиксированной ставке: изображение занимает 280 токенов, кадр видео - 140, одна секунда аудио - 25. Итого в один запрос влезает до 29 изображений, 58 видеокадров или 5,5 минут аудио - или их произвольное сочетание.
Память и хранилище
На Google Pixel 11 Pro с квантизацией текстовая версия занимает около 191 МБ оперативной памяти, полная мультимодальная - 567 МБ. Для смартфона 2026 года это вполне рабочие цифры.
С векторами отдельная история. Каждый эмбеддинг по умолчанию - список из 768 чисел. Миллион таких векторов в bfloat16 занимает около 1,5 ГБ. Техника Matryoshka Representation Learning (MRL) позволяет усечь размерность до 512, 256 или 128 - хранилище при этом сжимается до шести раз. Согласно руководству для разработчиков, 256-мерные векторы сохраняют около 95% качества на изображениях, видео и речи. 128 измерений держат примерно 90% качества для текста и кода, но на мультимодальных задачах качество падает до ~75% - это честное предупреждение, которое Google не прячет.
Бенчмарки
Самый заметный прирост - в коде: MTEB Code вырос с 68,76 до 78,68, то есть на 9,92 пункта. Для разработчиков, которые строят семантический поиск по кодовой базе или retrieval для coding-агентов, это существенно.
По мультиязычному тексту (MTEB multilingual v2) модель набирает 61,36, по визуальным документам - 67,84, по видеопоиску - 50,67, по аудиозадачам MAEB - 49,39. Google заявляет лидерство среди мультимодальных моделей до 1 млрд параметров и утверждает, что EmbeddingGemma 2 превосходит некоторые специализированные модели вдвое большего размера.
Многоязычный текст практически не изменился по сравнению с первой версией - здесь прогресс минимальный. Модель поддерживает более 100 языков, но Google прямо предупреждает: качество по ним неодинаковое.
Честность насчет безопасности
Модель не проходила safety-тюнинг и не имеет модерации выходных данных. Google применял защитные меры на уровне обучающих данных. Это стандартная практика для открытых embedding-моделей, но важно понимать: если вы строите на ней продукт, фильтрацию придется добавлять самостоятельно.
Интеграция и экосистема
В сочетании с генеративными моделями вроде Gemma 4 EmbeddingGemma 2 позволяет строить RAG-пайплайны полностью на устройстве. В демо-приложении AI Edge Gallery есть функция Video Moments Finder - поиск момента в видео по текстовому или голосовому запросу. Google также использует EmbeddingGemma 2 в приложении AI Edge Foresight.
Веса доступны на Hugging Face и Kaggle прямо сейчас. Модель работает с открытыми инструментами: vLLM, llama.cpp, Ollama. В Model Garden на Gemini Enterprise Agent Platform появится позже.
Лицензия Apache 2.0 допускает коммерческое использование, однако на модель также распространяется Gemma Prohibited Use Policy - перед использованием в продукте стоит с ней ознакомиться.
Что это значит для разработчиков
RAG-пайплайн без сетевых запросов - давняя мечта тех, кто работает с чувствительными данными. Медицинские записи, юридические документы, корпоративные кодовые базы - все это теперь можно индексировать и искать локально, без облака. 567 МБ для полной мультимодальной модели - цена вполне подъемная даже для мобильного приложения.
Для российских разработчиков: веса опубликованы на Hugging Face, весят разумно, работают офлайн. VPN для скачивания может понадобиться в зависимости от провайдера, но сама модель после загрузки работает автономно.
Конкуренты в этом сегменте - CLIP-подобные модели и открытые варианты вроде nomic-embed-multimodal. EmbeddingGemma 2 выигрывает за счет нативной поддержки аудио (большинство конкурентов его не умеют), модульности и оптимизации под мобильное железо.
Главный вопрос, который остается открытым: насколько хорошо модель справляется с русским языком в аудио и визуальных задачах. Google говорит про 100+ языков, но детализации по конкретным языкам в открытых материалах нет. Это придется проверять на практике.
Информация подтверждена несколькими независимыми публикациями.
Похожие новости
Google урезает бесплатный Gemini: с 9 октября только Flash Lite
С 9 октября бесплатные пользователи Gemini получат доступ только к Flash Lite. Платный AI Plus тоже теряет Pro - теперь он только в подписках за $20 и $100 в месяц.
Aleph Alpha выпустила Kolibri-1: 78B MoE с немецким языком и 1M токенов
Немецкая Aleph Alpha открыла веса модели Kolibri-1 под Apache 2.0: 78B параметров, из которых на каждый токен тратится лишь 3.46B, контекст до 1M токенов и ставка на суверенный ИИ.
Google урезает бесплатный Gemini: теперь только слабейшая модель
С октября 2026 Google оставляет бесплатным пользователям только Flash-Lite - самую слабую версию Gemini. Flash и Pro уходят за paywall.