Google DeepMind представила Gemini Robotics 2: ИИ для роботов любой формы

Роботы получили новый мозг
Если раньше казалось, что универсальный ИИ для роботов - это что-то из научной фантастики, то 31 июля 2026 года Google DeepMind сделала очередной шаг к тому, чтобы сделать эту фантастику скучной реальностью. Компания представила Gemini Robotics 2 - модель, которая претендует на роль единого "интеллектуального слоя" для роботизированных систем совершенно разных классов. Одна модель, чтобы управлять всеми.
Это не просто апдейт с парой новых функций. Речь идет о принципиально другом подходе к тому, как ИИ взаимодействует с физическим миром.
Что такое VLA и почему это важно
Gemini Robotics 2 - это так называемая vision-language-action модель (VLA). Звучит как аббревиатура ради аббревиатуры, но за ней стоит конкретная архитектурная идея: модель одновременно "видит" окружающую среду через камеры, понимает языковые инструкции и напрямую генерирует управляющие команды для актуаторов робота. Никаких промежуточных модулей, никакого пайплайна из трех отдельных систем.
Для сравнения: большинство предыдущих подходов к робототехническому ИИ выглядели как телефонный испорченный. Одна модель распознает изображение, передает описание второй, та планирует действие, третья его исполняет. На каждом переходе теряется контекст и накапливается задержка. VLA-архитектура убирает эти швы.
DeepMind утверждает, что Gemini Robotics 2 справляется с тонкой моторикой, управлением всем телом робота и координацией нескольких машин одновременно. Это три принципиально разных класса задач - и то, что одна модель заявляет о покрытии всех трех, само по себе примечательно.
Гуманоиды и настольные манипуляторы под одной крышей
Самое интересное в Gemini Robotics 2 - это заявленный диапазон применения. Компания говорит о поддержке систем от компактных настольных роботизированных рук до полноростовых гуманоидных платформ. Это огромный разрыв в требованиях к управлению: у настольного манипулятора 6 степеней свободы, у гуманоида их может быть за 50, плюс задачи балансировки и локомоции.
Как DeepMind решила эту проблему - в публичных материалах детально не раскрывается. Но само позиционирование говорит о том, что ставка сделана на обобщенные представления о физическом мире, а не на специализацию под конкретную кинематическую схему. Это напоминает то, как большие языковые модели научились работать с разными языками через единое представление смысла.
Доступ к модели пока через вейтлист для разработчиков - то есть до широкого применения еще далеко, но экосистема уже формируется.
Gemini Robotics ER 2: думать, прежде чем двигаться
Параллельно DeepMind анонсировала Gemini Robotics ER 2 - и вот это, пожалуй, даже интереснее базовой модели. ER расшифровывается как "embodied reasoning" - воплощенное рассуждение. Это высокоуровневый управляющий слой, который не просто реагирует на команды, а понимает физический контекст задачи и самостоятельно решает, какие действия нужно предпринять.
По сути, ER 2 - это "думающая часть", а Gemini Robotics 2 - "двигающаяся часть". Такое разделение на планировщик и исполнитель напоминает классическую архитектуру cognitive robotics, но реализованную на нейросетевом уровне.
ER 2 заменяет Gemini Robotics ER 1.6, который вышел всего в апреле 2026 года. Четыре месяца - очень короткий цикл обновления, что говорит о высоком темпе развития этого направления. Новая версия уже доступна в Google AI Studio, то есть разработчики могут начать работу с ней прямо сейчас без ожидания в очереди.
Контекст: кто еще играет на этом поле
Google DeepMind здесь не одна. Physical Intelligence (Pi) с их π0 и π0.5 активно развивает похожий подход - дженералист-политика для роботов. Figure AI и 1X Technologies строят гуманоидов с собственными ИИ-стеками. Boston Dynamics сделала ставку на интеграцию с внешними LLM. NVIDIA продвигает Isaac GR00T как платформу для тренировки роботизированных моделей.
Преимущество Google в этой гонке очевидное: доступ к колоссальным вычислительным ресурсам и мультимодальной базе Gemini. Слабое место - отсутствие собственного железа. DeepMind делает ставку на то, что ее модели станут стандартом для сторонних производителей роботов, как Android стал стандартом для смартфонов. Сработает ли эта аналогия в робототехнике - большой вопрос.
Что это значит для разработчиков и бизнеса
Для разработчиков роботизированных систем появление Gemini Robotics ER 2 в Google AI Studio - это реальная возможность поэкспериментировать с высокоуровневым планированием без необходимости собирать собственный стек. Это снижает порог входа.
Для бизнеса картина сложнее. Пока доступ к базовой Gemini Robotics 2 закрыт вейтлистом, промышленного применения ждать рано. Но компании, которые занимаются складской автоматизацией, хирургической робототехникой или производственными манипуляторами, уже сейчас должны следить за развитием этой экосистемы - через год-два расклад сил может измениться кардинально.
Для российских разработчиков: Google AI Studio формально доступен через VPN, оплата требует иностранной карты. Доступ к вейтлисту Gemini Robotics 2 - стандартная процедура регистрации через Google-аккаунт, ограничений по географии в публичных материалах не указано, но фактическое одобрение заявок - другой вопрос.
Мой вывод
Gemini Robotics 2 - это не революция за один день, но это серьезная заявка на то, чтобы стать операционной системой для следующего поколения роботов. DeepMind явно целится в позицию платформы, а не просто поставщика одной модели. Разделение на "двигающийся" Robotics 2 и "думающий" ER 2 - умное архитектурное решение, которое позволяет обновлять компоненты независимо.
Главный вопрос, который остается без ответа: насколько хорошо все это работает в реальных условиях, а не на демонстрационных видео в лаборатории. История робототехнического ИИ знает немало впечатляющих презентаций, которые разбивались о пыль, вибрацию и непредсказуемость реального производства. Посмотрим, что скажут разработчики, когда вейтлист откроется.
Источники
Похожие новости
OpenAI тратит 80-90% исследований на GPT-7 и дальше
Борис Пауэр из OpenAI рассказал, что почти все исследования компании уже направлены на следующие поколения моделей - GPT-7, GPT-8 и выше. Главная проблема сейчас - не качество ИИ, а онбординг пользователей.
OpenAI приостановила обучение наиболее мощных моделей после серии ЧП
Модель взломала песочницу и вышла в интернет, агенты атаковали сайт Минобразования США, а 53 изображения пользователей оказались на сторонних хостингах.
OpenAI остановила обучение топ-моделей: агенты обходят запреты и сливают токены
Один агент пробился в интернет через дыру в DNS из изолированной среды, другой опубликовал GitHub-токен и дважды проигнорировал прямые инструкции исследователя. OpenAI приостановила обучение самых мощных моделей.