Google DeepMind запустила Gemini Robotics ER 2: роботы теперь думают и сотрудничают

Мозг для роботов — это уже не метафора
Если вы думали, что роботизация — это всё ещё про механические манипуляторы на конвейерах Toyota, 30 июля 2026 года Google DeepMind вас разубедила. Компания анонсировала Gemini Robotics ER 2 — модель, которую сами разработчики называют «высокоуровневым мозгом для роботов». И это не маркетинговый буллшит: за этим стоит реальная архитектурная идея, которая меняет то, как мы вообще думаем о физических ИИ-агентах.
Аббревиатура ER расшифровывается как «embodied reasoning» — «воплощённое рассуждение». Предыдущая версия, ER 1.6, уже умела кое-что интересное, но ER 2 — это качественный скачок, а не косметическое обновление.
Что умеет ER 2, чего не умел ER 1.6
Главная идея архитектуры: Gemini Robotics ER 2 — это не та модель, которая напрямую управляет сервоприводами. Она работает на уровне выше — планирует, рассуждает, координирует, а затем передаёт управление низкоуровневым VLA-моделям (Vision-Language-Action). Это разделение труда между «думать» и «делать» — принципиально умное решение.
Три ключевых улучшения по сравнению с предшественником:
1. Понимание видео в реальном времени. Робот теперь смотрит непрерывный видеопоток и отслеживает собственный прогресс. Споткнулся? Уронил деталь? Модель замечает это сама и корректирует план без команды оператора. Раньше такой самокоррекции практически не было — робот либо выполнял заложенный скрипт, либо падал в ошибку.
2. Оркестрация инструментов. ER 2 умеет нативно вызывать внешние инструменты — например, Google Search, если ей нужна информация для выполнения задачи, или любые пользовательские функции через API. Это превращает робота в настоящего агента, а не просто исполнителя.
3. Мультироботное взаимодействие. Это, пожалуй, самая захватывающая часть. Несколько роботов теперь могут координироваться в общем пространстве, разбивать сложные задачи на подзадачи и выполнять их параллельно. Один робот не справится с перемещением длинного стола — два справятся, если они умеют «договариваться».
Скорость как философия
В физическом мире время — это не абстракция. Пока ИИ-модель «думает» 3 секунды, рука робота уже может снести стакан со стола. Именно поэтому команда DeepMind интегрировала ER 2 с Gemini Live API — двунаправленным стриминговым эндпоинтом, оптимизированным под задачи с жёсткими требованиями к латентности.
Архитектурно это решено элегантно: модель может «думать о следующем шаге», пока одновременно выполняет текущее действие. Параллельное рассуждение и исполнение — это то, что отличает живые организмы от классических конечных автоматов. Google, судя по всему, реализовала нечто похожее.
Для сравнения: Boston Dynamics со своим Atlas использует совершенно другой подход — там акцент на физической надёжности и реактивном управлении, но не на высокоуровневом планировании. Figure и 1X строят более унифицированные стеки, но пока не могут похвастаться такой экосистемой API-интеграций, как Google.
Для разработчиков: как это потрогать
Gemini Robotics ER 2 уже доступен публично через три канала:
- Gemini API — стандартный путь для разработчиков - Google AI Studio — для тех, кто хочет поэкспериментировать без написания кода - Gemini Enterprise Agent Platform — в режиме private preview для корпоративных клиентов
DeepMind также публикует примеры конфигураций и промптов, что снижает порог входа. Разработчик может объявить низкоуровневые интерфейсы управления (VLA-модели, навигационные API) как инструменты и напрямую стримить в модель видео, аудио или текст. Это напоминает то, как работают агентные фреймворки типа LangChain или AutoGPT, только здесь «агент» физически существует в мире.
Для российских разработчиков: Gemini API формально доступен через стандартные инструменты, но с учётом ограничений Google на работу с российскими аккаунтами — скорее всего, понадобится VPN и нероссийская платёжная карта. Google AI Studio также требует аккаунт Google, зарегистрированный в поддерживаемом регионе.
Что это означает для рынка
Я смотрю на этот анонс и вижу не просто новую модель — вижу заявку на стандарт. Google создала слой абстракции между «думать» и «делать», который теоретически совместим с любым роботизированным железом. Если эта ставка сыграет, через два-три года мы увидим экосистему физических ИИ-агентов на базе Gemini, аналогичную тому, как Android стал платформой для мобильных устройств.
Особенно интересна мультироботная координация. Сегодня это выглядит как «два робота двигают стол», но завтра — это распределённые складские системы, строительные бригады из роботов, хирургические ассистенты, работающие в паре. Потенциал здесь колоссальный, и Google сделала правильный ход, открыв API разработчикам: пусть сообщество придумает применения, которые сами инженеры DeepMind не предусмотрели.
OpenAI с их инициативой в робототехнике (коллаборация с Figure) пока фокусируется на гуманоидах. Microsoft инвестирует в промышленную автоматизацию. Google же играет в платформенную игру — и это, по-моему, самая умная позиция на этом рынке прямо сейчас.
Источники
Похожие новости
OpenAI распустила команду по катастрофическим рискам ИИ
OpenAI тихо ликвидировала отдел Preparedness, который оценивал угрозы от собственных моделей. Сотрудники говорят о нарастающем «чувстве тревоги и ответственности».
Optima: бенчмарки ИИ наконец-то на ваших реальных данных
Artificial Analysis запустила платформу Optima, которая позволяет строить персональные бенчмарки для LLM на основе собственных данных и сравнивать модели не только по качеству, но и по стоимости задачи.
ИИ-книги затопили Amazon и режут доходы живых авторов
Исследование 14 000 книг показало: ИИ-контент занял 20% каталога, но забирает лишь 12% выручки — зато тянет вниз доходы всех авторов без исключения.