G
ИИ-чатGoogle DeepMindGemini Robotics ER 2робототехникафизический ИИмультиагентные системы

Google DeepMind запустила Gemini Robotics ER 2: роботы теперь думают и сотрудничают

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
Google DeepMind запустила Gemini Robotics ER 2: роботы теперь думают и сотрудничают

Мозг для роботов - это уже не метафора

Если вы думали, что роботизация - это все еще про механические манипуляторы на конвейерах Toyota, 30 июля 2026 года Google DeepMind вас разубедила. Компания анонсировала Gemini Robotics ER 2 - модель, которую сами разработчики называют "высокоуровневым мозгом для роботов". И это не маркетинговый буллшит: за этим стоит реальная архитектурная идея, которая меняет то, как мы вообще думаем о физических ИИ-агентах.

Аббревиатура ER расшифровывается как "embodied reasoning" - "воплощенное рассуждение". Предыдущая версия, ER 1.6, уже умела кое-что интересное, но ER 2 - это качественный скачок, а не косметическое обновление.

Что умеет ER 2, чего не умел ER 1.6

Главная идея архитектуры: Gemini Robotics ER 2 - это не та модель, которая напрямую управляет сервоприводами. Она работает на уровне выше - планирует, рассуждает, координирует, а затем передает управление низкоуровневым VLA-моделям (Vision-Language-Action). Это разделение труда между "думать" и "делать" - принципиально умное решение.

Три ключевых улучшения по сравнению с предшественником:

1. Понимание видео в реальном времени. Робот теперь смотрит непрерывный видеопоток и отслеживает собственный прогресс. Споткнулся? Уронил деталь? Модель замечает это сама и корректирует план без команды оператора. Раньше такой самокоррекции практически не было - робот либо выполнял заложенный скрипт, либо падал в ошибку.

2. Оркестрация инструментов. ER 2 умеет нативно вызывать внешние инструменты - например, Google Search, если ей нужна информация для выполнения задачи, или любые пользовательские функции через API. Это превращает робота в настоящего агента, а не просто исполнителя.

3. Мультироботное взаимодействие. Это, пожалуй, самая захватывающая часть. Несколько роботов теперь могут координироваться в общем пространстве, разбивать сложные задачи на подзадачи и выполнять их параллельно. Один робот не справится с перемещением длинного стола - два справятся, если они умеют "договариваться".

Скорость как философия

В физическом мире время - это не абстракция. Пока ИИ-модель "думает" 3 секунды, рука робота уже может снести стакан со стола. Именно поэтому команда DeepMind интегрировала ER 2 с Gemini Live API - двунаправленным стриминговым эндпоинтом, оптимизированным под задачи с жесткими требованиями к латентности.

Архитектурно это решено элегантно: модель может "думать о следующем шаге", пока одновременно выполняет текущее действие. Параллельное рассуждение и исполнение - это то, что отличает живые организмы от классических конечных автоматов. Google, судя по всему, реализовала нечто похожее.

Для сравнения: Boston Dynamics со своим Atlas использует совершенно другой подход - там акцент на физической надежности и реактивном управлении, но не на высокоуровневом планировании. Figure и 1X строят более унифицированные стеки, но пока не могут похвастаться такой экосистемой API-интеграций, как Google.

Для разработчиков: как это потрогать

Gemini Robotics ER 2 уже доступен публично через три канала:

- Gemini API - стандартный путь для разработчиков - Google AI Studio - для тех, кто хочет поэкспериментировать без написания кода - Gemini Enterprise Agent Platform - в режиме private preview для корпоративных клиентов

DeepMind также публикует примеры конфигураций и промптов, что снижает порог входа. Разработчик может объявить низкоуровневые интерфейсы управления (VLA-модели, навигационные API) как инструменты и напрямую стримить в модель видео, аудио или текст. Это напоминает то, как работают агентные фреймворки типа LangChain или AutoGPT, только здесь "агент" физически существует в мире.

Для российских разработчиков: Gemini API формально доступен через стандартные инструменты, но с учетом ограничений Google на работу с российскими аккаунтами - скорее всего, понадобится VPN и нероссийская платежная карта. Google AI Studio также требует аккаунт Google, зарегистрированный в поддерживаемом регионе.

Что это означает для рынка

Я смотрю на этот анонс и вижу не просто новую модель - вижу заявку на стандарт. Google создала слой абстракции между "думать" и "делать", который теоретически совместим с любым роботизированным железом. Если эта ставка сыграет, через два-три года мы увидим экосистему физических ИИ-агентов на базе Gemini, аналогичную тому, как Android стал платформой для мобильных устройств.

Особенно интересна мультироботная координация. Сегодня это выглядит как "два робота двигают стол", но завтра - это распределенные складские системы, строительные бригады из роботов, хирургические ассистенты, работающие в паре. Потенциал здесь колоссальный, и Google сделала правильный ход, открыв API разработчикам: пусть сообщество придумает применения, которые сами инженеры DeepMind не предусмотрели.

OpenAI с их инициативой в робототехнике (коллаборация с Figure) пока фокусируется на гуманоидах. Microsoft инвестирует в промышленную автоматизацию. Google же играет в платформенную игру - и это, по-моему, самая умная позиция на этом рынке прямо сейчас.

Источники

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости