G
ИИ-чатGoogle DeepMindGemini Robotics 2VLA-моделиробототехникагуманоидные роботы

Google DeepMind представила Gemini Robotics 2: ИИ для роботов любой формы

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·5 мин чтения
Google DeepMind представила Gemini Robotics 2: ИИ для роботов любой формы

Роботы получили новый мозг

Если раньше казалось, что универсальный ИИ для роботов — это что-то из научной фантастики, то 31 июля 2026 года Google DeepMind сделала очередной шаг к тому, чтобы сделать эту фантастику скучной реальностью. Компания представила Gemini Robotics 2 — модель, которая претендует на роль единого «интеллектуального слоя» для роботизированных систем совершенно разных классов. Одна модель, чтобы управлять всеми.

Это не просто апдейт с парой новых функций. Речь идёт о принципиально другом подходе к тому, как ИИ взаимодействует с физическим миром.

Что такое VLA и почему это важно

Gemini Robotics 2 — это так называемая vision-language-action модель (VLA). Звучит как аббревиатура ради аббревиатуры, но за ней стоит конкретная архитектурная идея: модель одновременно «видит» окружающую среду через камеры, понимает языковые инструкции и напрямую генерирует управляющие команды для актуаторов робота. Никаких промежуточных модулей, никакого пайплайна из трёх отдельных систем.

Для сравнения: большинство предыдущих подходов к робототехническому ИИ выглядели как телефонный испорченный. Одна модель распознаёт изображение, передаёт описание второй, та планирует действие, третья его исполняет. На каждом переходе теряется контекст и накапливается задержка. VLA-архитектура убирает эти швы.

DeepMind утверждает, что Gemini Robotics 2 справляется с тонкой моторикой, управлением всем телом робота и координацией нескольких машин одновременно. Это три принципиально разных класса задач — и то, что одна модель заявляет о покрытии всех трёх, само по себе примечательно.

Гуманоиды и настольные манипуляторы под одной крышей

Самое интересное в Gemini Robotics 2 — это заявленный диапазон применения. Компания говорит о поддержке систем от компактных настольных роботизированных рук до полноростовых гуманоидных платформ. Это огромный разрыв в требованиях к управлению: у настольного манипулятора 6 степеней свободы, у гуманоида их может быть за 50, плюс задачи балансировки и локомоции.

Как DeepMind решила эту проблему — в публичных материалах детально не раскрывается. Но само позиционирование говорит о том, что ставка сделана на обобщённые представления о физическом мире, а не на специализацию под конкретную кинематическую схему. Это напоминает то, как большие языковые модели научились работать с разными языками через единое представление смысла.

Доступ к модели пока через вейтлист для разработчиков — то есть до широкого применения ещё далеко, но экосистема уже формируется.

Gemini Robotics ER 2: думать, прежде чем двигаться

Параллельно DeepMind анонсировала Gemini Robotics ER 2 — и вот это, пожалуй, даже интереснее базовой модели. ER расшифровывается как «embodied reasoning» — воплощённое рассуждение. Это высокоуровневый управляющий слой, который не просто реагирует на команды, а понимает физический контекст задачи и самостоятельно решает, какие действия нужно предпринять.

По сути, ER 2 — это «думающая часть», а Gemini Robotics 2 — «двигающаяся часть». Такое разделение на планировщик и исполнитель напоминает классическую архитектуру cognitive robotics, но реализованную на нейросетевом уровне.

ER 2 заменяет Gemini Robotics ER 1.6, который вышел всего в апреле 2026 года. Четыре месяца — очень короткий цикл обновления, что говорит о высоком темпе развития этого направления. Новая версия уже доступна в Google AI Studio, то есть разработчики могут начать работу с ней прямо сейчас без ожидания в очереди.

Контекст: кто ещё играет на этом поле

Google DeepMind здесь не одна. Physical Intelligence (Pi) с их π0 и π0.5 активно развивает похожий подход — дженералист-политика для роботов. Figure AI и 1X Technologies строят гуманоидов с собственными ИИ-стеками. Boston Dynamics сделала ставку на интеграцию с внешними LLM. NVIDIA продвигает Isaac GR00T как платформу для тренировки роботизированных моделей.

Преимущество Google в этой гонке очевидное: доступ к колоссальным вычислительным ресурсам и мультимодальной базе Gemini. Слабое место — отсутствие собственного железа. DeepMind делает ставку на то, что её модели станут стандартом для сторонних производителей роботов, как Android стал стандартом для смартфонов. Сработает ли эта аналогия в робототехнике — большой вопрос.

Что это значит для разработчиков и бизнеса

Для разработчиков роботизированных систем появление Gemini Robotics ER 2 в Google AI Studio — это реальная возможность поэкспериментировать с высокоуровневым планированием без необходимости собирать собственный стек. Это снижает порог входа.

Для бизнеса картина сложнее. Пока доступ к базовой Gemini Robotics 2 закрыт вейтлистом, промышленного применения ждать рано. Но компании, которые занимаются складской автоматизацией, хирургической робототехникой или производственными манипуляторами, уже сейчас должны следить за развитием этой экосистемы — через год-два расклад сил может измениться кардинально.

Для российских разработчиков: Google AI Studio формально доступен через VPN, оплата требует иностранной карты. Доступ к вейтлисту Gemini Robotics 2 — стандартная процедура регистрации через Google-аккаунт, ограничений по географии в публичных материалах не указано, но фактическое одобрение заявок — другой вопрос.

Мой вывод

Gemini Robotics 2 — это не революция за один день, но это серьёзная заявка на то, чтобы стать операционной системой для следующего поколения роботов. DeepMind явно целится в позицию платформы, а не просто поставщика одной модели. Разделение на «двигающийся» Robotics 2 и «думающий» ER 2 — умное архитектурное решение, которое позволяет обновлять компоненты независимо.

Главный вопрос, который остаётся без ответа: насколько хорошо всё это работает в реальных условиях, а не на демонстрационных видео в лаборатории. История робототехнического ИИ знает немало впечатляющих презентаций, которые разбивались о пыль, вибрацию и непредсказуемость реального производства. Посмотрим, что скажут разработчики, когда вейтлист откроется.

Источники

Все эти инструменты — уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости