G
ИИ-чатGoogle DeepMindGemini Robotics ER 2робототехникафизический ИИмультиагентные системы

Google DeepMind запустила Gemini Robotics ER 2: роботы теперь думают и сотрудничают

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
Google DeepMind запустила Gemini Robotics ER 2: роботы теперь думают и сотрудничают

Мозг для роботов — это уже не метафора

Если вы думали, что роботизация — это всё ещё про механические манипуляторы на конвейерах Toyota, 30 июля 2026 года Google DeepMind вас разубедила. Компания анонсировала Gemini Robotics ER 2 — модель, которую сами разработчики называют «высокоуровневым мозгом для роботов». И это не маркетинговый буллшит: за этим стоит реальная архитектурная идея, которая меняет то, как мы вообще думаем о физических ИИ-агентах.

Аббревиатура ER расшифровывается как «embodied reasoning» — «воплощённое рассуждение». Предыдущая версия, ER 1.6, уже умела кое-что интересное, но ER 2 — это качественный скачок, а не косметическое обновление.

Что умеет ER 2, чего не умел ER 1.6

Главная идея архитектуры: Gemini Robotics ER 2 — это не та модель, которая напрямую управляет сервоприводами. Она работает на уровне выше — планирует, рассуждает, координирует, а затем передаёт управление низкоуровневым VLA-моделям (Vision-Language-Action). Это разделение труда между «думать» и «делать» — принципиально умное решение.

Три ключевых улучшения по сравнению с предшественником:

1. Понимание видео в реальном времени. Робот теперь смотрит непрерывный видеопоток и отслеживает собственный прогресс. Споткнулся? Уронил деталь? Модель замечает это сама и корректирует план без команды оператора. Раньше такой самокоррекции практически не было — робот либо выполнял заложенный скрипт, либо падал в ошибку.

2. Оркестрация инструментов. ER 2 умеет нативно вызывать внешние инструменты — например, Google Search, если ей нужна информация для выполнения задачи, или любые пользовательские функции через API. Это превращает робота в настоящего агента, а не просто исполнителя.

3. Мультироботное взаимодействие. Это, пожалуй, самая захватывающая часть. Несколько роботов теперь могут координироваться в общем пространстве, разбивать сложные задачи на подзадачи и выполнять их параллельно. Один робот не справится с перемещением длинного стола — два справятся, если они умеют «договариваться».

Скорость как философия

В физическом мире время — это не абстракция. Пока ИИ-модель «думает» 3 секунды, рука робота уже может снести стакан со стола. Именно поэтому команда DeepMind интегрировала ER 2 с Gemini Live API — двунаправленным стриминговым эндпоинтом, оптимизированным под задачи с жёсткими требованиями к латентности.

Архитектурно это решено элегантно: модель может «думать о следующем шаге», пока одновременно выполняет текущее действие. Параллельное рассуждение и исполнение — это то, что отличает живые организмы от классических конечных автоматов. Google, судя по всему, реализовала нечто похожее.

Для сравнения: Boston Dynamics со своим Atlas использует совершенно другой подход — там акцент на физической надёжности и реактивном управлении, но не на высокоуровневом планировании. Figure и 1X строят более унифицированные стеки, но пока не могут похвастаться такой экосистемой API-интеграций, как Google.

Для разработчиков: как это потрогать

Gemini Robotics ER 2 уже доступен публично через три канала:

- Gemini API — стандартный путь для разработчиков - Google AI Studio — для тех, кто хочет поэкспериментировать без написания кода - Gemini Enterprise Agent Platform — в режиме private preview для корпоративных клиентов

DeepMind также публикует примеры конфигураций и промптов, что снижает порог входа. Разработчик может объявить низкоуровневые интерфейсы управления (VLA-модели, навигационные API) как инструменты и напрямую стримить в модель видео, аудио или текст. Это напоминает то, как работают агентные фреймворки типа LangChain или AutoGPT, только здесь «агент» физически существует в мире.

Для российских разработчиков: Gemini API формально доступен через стандартные инструменты, но с учётом ограничений Google на работу с российскими аккаунтами — скорее всего, понадобится VPN и нероссийская платёжная карта. Google AI Studio также требует аккаунт Google, зарегистрированный в поддерживаемом регионе.

Что это означает для рынка

Я смотрю на этот анонс и вижу не просто новую модель — вижу заявку на стандарт. Google создала слой абстракции между «думать» и «делать», который теоретически совместим с любым роботизированным железом. Если эта ставка сыграет, через два-три года мы увидим экосистему физических ИИ-агентов на базе Gemini, аналогичную тому, как Android стал платформой для мобильных устройств.

Особенно интересна мультироботная координация. Сегодня это выглядит как «два робота двигают стол», но завтра — это распределённые складские системы, строительные бригады из роботов, хирургические ассистенты, работающие в паре. Потенциал здесь колоссальный, и Google сделала правильный ход, открыв API разработчикам: пусть сообщество придумает применения, которые сами инженеры DeepMind не предусмотрели.

OpenAI с их инициативой в робототехнике (коллаборация с Figure) пока фокусируется на гуманоидах. Microsoft инвестирует в промышленную автоматизацию. Google же играет в платформенную игру — и это, по-моему, самая умная позиция на этом рынке прямо сейчас.

Источники

Все эти инструменты — уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости