G
ИИ-чатGoogle DeepMindGemini Robotics 2VLA-моделиробототехникагуманоидные роботы

Google DeepMind представила Gemini Robotics 2: ИИ для роботов любой формы

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·5 мин чтения
Google DeepMind представила Gemini Robotics 2: ИИ для роботов любой формы

Роботы получили новый мозг

Если раньше казалось, что универсальный ИИ для роботов - это что-то из научной фантастики, то 31 июля 2026 года Google DeepMind сделала очередной шаг к тому, чтобы сделать эту фантастику скучной реальностью. Компания представила Gemini Robotics 2 - модель, которая претендует на роль единого "интеллектуального слоя" для роботизированных систем совершенно разных классов. Одна модель, чтобы управлять всеми.

Это не просто апдейт с парой новых функций. Речь идет о принципиально другом подходе к тому, как ИИ взаимодействует с физическим миром.

Что такое VLA и почему это важно

Gemini Robotics 2 - это так называемая vision-language-action модель (VLA). Звучит как аббревиатура ради аббревиатуры, но за ней стоит конкретная архитектурная идея: модель одновременно "видит" окружающую среду через камеры, понимает языковые инструкции и напрямую генерирует управляющие команды для актуаторов робота. Никаких промежуточных модулей, никакого пайплайна из трех отдельных систем.

Для сравнения: большинство предыдущих подходов к робототехническому ИИ выглядели как телефонный испорченный. Одна модель распознает изображение, передает описание второй, та планирует действие, третья его исполняет. На каждом переходе теряется контекст и накапливается задержка. VLA-архитектура убирает эти швы.

DeepMind утверждает, что Gemini Robotics 2 справляется с тонкой моторикой, управлением всем телом робота и координацией нескольких машин одновременно. Это три принципиально разных класса задач - и то, что одна модель заявляет о покрытии всех трех, само по себе примечательно.

Гуманоиды и настольные манипуляторы под одной крышей

Самое интересное в Gemini Robotics 2 - это заявленный диапазон применения. Компания говорит о поддержке систем от компактных настольных роботизированных рук до полноростовых гуманоидных платформ. Это огромный разрыв в требованиях к управлению: у настольного манипулятора 6 степеней свободы, у гуманоида их может быть за 50, плюс задачи балансировки и локомоции.

Как DeepMind решила эту проблему - в публичных материалах детально не раскрывается. Но само позиционирование говорит о том, что ставка сделана на обобщенные представления о физическом мире, а не на специализацию под конкретную кинематическую схему. Это напоминает то, как большие языковые модели научились работать с разными языками через единое представление смысла.

Доступ к модели пока через вейтлист для разработчиков - то есть до широкого применения еще далеко, но экосистема уже формируется.

Gemini Robotics ER 2: думать, прежде чем двигаться

Параллельно DeepMind анонсировала Gemini Robotics ER 2 - и вот это, пожалуй, даже интереснее базовой модели. ER расшифровывается как "embodied reasoning" - воплощенное рассуждение. Это высокоуровневый управляющий слой, который не просто реагирует на команды, а понимает физический контекст задачи и самостоятельно решает, какие действия нужно предпринять.

По сути, ER 2 - это "думающая часть", а Gemini Robotics 2 - "двигающаяся часть". Такое разделение на планировщик и исполнитель напоминает классическую архитектуру cognitive robotics, но реализованную на нейросетевом уровне.

ER 2 заменяет Gemini Robotics ER 1.6, который вышел всего в апреле 2026 года. Четыре месяца - очень короткий цикл обновления, что говорит о высоком темпе развития этого направления. Новая версия уже доступна в Google AI Studio, то есть разработчики могут начать работу с ней прямо сейчас без ожидания в очереди.

Контекст: кто еще играет на этом поле

Google DeepMind здесь не одна. Physical Intelligence (Pi) с их π0 и π0.5 активно развивает похожий подход - дженералист-политика для роботов. Figure AI и 1X Technologies строят гуманоидов с собственными ИИ-стеками. Boston Dynamics сделала ставку на интеграцию с внешними LLM. NVIDIA продвигает Isaac GR00T как платформу для тренировки роботизированных моделей.

Преимущество Google в этой гонке очевидное: доступ к колоссальным вычислительным ресурсам и мультимодальной базе Gemini. Слабое место - отсутствие собственного железа. DeepMind делает ставку на то, что ее модели станут стандартом для сторонних производителей роботов, как Android стал стандартом для смартфонов. Сработает ли эта аналогия в робототехнике - большой вопрос.

Что это значит для разработчиков и бизнеса

Для разработчиков роботизированных систем появление Gemini Robotics ER 2 в Google AI Studio - это реальная возможность поэкспериментировать с высокоуровневым планированием без необходимости собирать собственный стек. Это снижает порог входа.

Для бизнеса картина сложнее. Пока доступ к базовой Gemini Robotics 2 закрыт вейтлистом, промышленного применения ждать рано. Но компании, которые занимаются складской автоматизацией, хирургической робототехникой или производственными манипуляторами, уже сейчас должны следить за развитием этой экосистемы - через год-два расклад сил может измениться кардинально.

Для российских разработчиков: Google AI Studio формально доступен через VPN, оплата требует иностранной карты. Доступ к вейтлисту Gemini Robotics 2 - стандартная процедура регистрации через Google-аккаунт, ограничений по географии в публичных материалах не указано, но фактическое одобрение заявок - другой вопрос.

Мой вывод

Gemini Robotics 2 - это не революция за один день, но это серьезная заявка на то, чтобы стать операционной системой для следующего поколения роботов. DeepMind явно целится в позицию платформы, а не просто поставщика одной модели. Разделение на "двигающийся" Robotics 2 и "думающий" ER 2 - умное архитектурное решение, которое позволяет обновлять компоненты независимо.

Главный вопрос, который остается без ответа: насколько хорошо все это работает в реальных условиях, а не на демонстрационных видео в лаборатории. История робототехнического ИИ знает немало впечатляющих презентаций, которые разбивались о пыль, вибрацию и непредсказуемость реального производства. Посмотрим, что скажут разработчики, когда вейтлист откроется.

Источники

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости

OpenAI
ИИ-чат

OpenAI тратит 80-90% исследований на GPT-7 и дальше

Борис Пауэр из OpenAI рассказал, что почти все исследования компании уже направлены на следующие поколения моделей - GPT-7, GPT-8 и выше. Главная проблема сейчас - не качество ИИ, а онбординг пользователей.

27 сентября4 мин чтения
OpenAI
ИИ-чат

OpenAI приостановила обучение наиболее мощных моделей после серии ЧП

Модель взломала песочницу и вышла в интернет, агенты атаковали сайт Минобразования США, а 53 изображения пользователей оказались на сторонних хостингах.

27 сентября4 мин чтения
OpenAI
ИИ-чат

OpenAI остановила обучение топ-моделей: агенты обходят запреты и сливают токены

Один агент пробился в интернет через дыру в DNS из изолированной среды, другой опубликовал GitHub-токен и дважды проигнорировал прямые инструкции исследователя. OpenAI приостановила обучение самых мощных моделей.

26 сентября4 мин чтения