Google DeepMind запустила Gemini Robotics ER 2: роботы теперь думают и сотрудничают

Мозг для роботов - это уже не метафора
Если вы думали, что роботизация - это все еще про механические манипуляторы на конвейерах Toyota, 30 июля 2026 года Google DeepMind вас разубедила. Компания анонсировала Gemini Robotics ER 2 - модель, которую сами разработчики называют "высокоуровневым мозгом для роботов". И это не маркетинговый буллшит: за этим стоит реальная архитектурная идея, которая меняет то, как мы вообще думаем о физических ИИ-агентах.
Аббревиатура ER расшифровывается как "embodied reasoning" - "воплощенное рассуждение". Предыдущая версия, ER 1.6, уже умела кое-что интересное, но ER 2 - это качественный скачок, а не косметическое обновление.
Что умеет ER 2, чего не умел ER 1.6
Главная идея архитектуры: Gemini Robotics ER 2 - это не та модель, которая напрямую управляет сервоприводами. Она работает на уровне выше - планирует, рассуждает, координирует, а затем передает управление низкоуровневым VLA-моделям (Vision-Language-Action). Это разделение труда между "думать" и "делать" - принципиально умное решение.
Три ключевых улучшения по сравнению с предшественником:
1. Понимание видео в реальном времени. Робот теперь смотрит непрерывный видеопоток и отслеживает собственный прогресс. Споткнулся? Уронил деталь? Модель замечает это сама и корректирует план без команды оператора. Раньше такой самокоррекции практически не было - робот либо выполнял заложенный скрипт, либо падал в ошибку.
2. Оркестрация инструментов. ER 2 умеет нативно вызывать внешние инструменты - например, Google Search, если ей нужна информация для выполнения задачи, или любые пользовательские функции через API. Это превращает робота в настоящего агента, а не просто исполнителя.
3. Мультироботное взаимодействие. Это, пожалуй, самая захватывающая часть. Несколько роботов теперь могут координироваться в общем пространстве, разбивать сложные задачи на подзадачи и выполнять их параллельно. Один робот не справится с перемещением длинного стола - два справятся, если они умеют "договариваться".
Скорость как философия
В физическом мире время - это не абстракция. Пока ИИ-модель "думает" 3 секунды, рука робота уже может снести стакан со стола. Именно поэтому команда DeepMind интегрировала ER 2 с Gemini Live API - двунаправленным стриминговым эндпоинтом, оптимизированным под задачи с жесткими требованиями к латентности.
Архитектурно это решено элегантно: модель может "думать о следующем шаге", пока одновременно выполняет текущее действие. Параллельное рассуждение и исполнение - это то, что отличает живые организмы от классических конечных автоматов. Google, судя по всему, реализовала нечто похожее.
Для сравнения: Boston Dynamics со своим Atlas использует совершенно другой подход - там акцент на физической надежности и реактивном управлении, но не на высокоуровневом планировании. Figure и 1X строят более унифицированные стеки, но пока не могут похвастаться такой экосистемой API-интеграций, как Google.
Для разработчиков: как это потрогать
Gemini Robotics ER 2 уже доступен публично через три канала:
- Gemini API - стандартный путь для разработчиков - Google AI Studio - для тех, кто хочет поэкспериментировать без написания кода - Gemini Enterprise Agent Platform - в режиме private preview для корпоративных клиентов
DeepMind также публикует примеры конфигураций и промптов, что снижает порог входа. Разработчик может объявить низкоуровневые интерфейсы управления (VLA-модели, навигационные API) как инструменты и напрямую стримить в модель видео, аудио или текст. Это напоминает то, как работают агентные фреймворки типа LangChain или AutoGPT, только здесь "агент" физически существует в мире.
Для российских разработчиков: Gemini API формально доступен через стандартные инструменты, но с учетом ограничений Google на работу с российскими аккаунтами - скорее всего, понадобится VPN и нероссийская платежная карта. Google AI Studio также требует аккаунт Google, зарегистрированный в поддерживаемом регионе.
Что это означает для рынка
Я смотрю на этот анонс и вижу не просто новую модель - вижу заявку на стандарт. Google создала слой абстракции между "думать" и "делать", который теоретически совместим с любым роботизированным железом. Если эта ставка сыграет, через два-три года мы увидим экосистему физических ИИ-агентов на базе Gemini, аналогичную тому, как Android стал платформой для мобильных устройств.
Особенно интересна мультироботная координация. Сегодня это выглядит как "два робота двигают стол", но завтра - это распределенные складские системы, строительные бригады из роботов, хирургические ассистенты, работающие в паре. Потенциал здесь колоссальный, и Google сделала правильный ход, открыв API разработчикам: пусть сообщество придумает применения, которые сами инженеры DeepMind не предусмотрели.
OpenAI с их инициативой в робототехнике (коллаборация с Figure) пока фокусируется на гуманоидах. Microsoft инвестирует в промышленную автоматизацию. Google же играет в платформенную игру - и это, по-моему, самая умная позиция на этом рынке прямо сейчас.
Источники
Похожие новости
OpenAI Dots: рабочий ИИ-агент, который заодно закажет ужин
OpenAI представила Dots - всегда активных агентов на базе GPT-6 Astra. Они работают как корпоративный софт, но при этом могут заказать бурито.
Ai2 открыла AstaBrief 8B: научные отчеты за 51 секунду
Allen Institute for AI выложил в открытый доступ модель AstaBrief 8B - она генерирует научные отчеты с цитатами в 3,5 раза быстрее Claude и стоит дешевле в обслуживании.
Ataraxos: ИИ за $8000 разгромил лучшего игрока в Stratego
Нейросеть от команды MIT, CMU, NYU и Stanford победила четырехкратного чемпиона мира по Stratego со счетом 15-1. DeepMind потратил на аналогичную попытку $3-4,5 млн - и уступил большинству топ-игроков.