DeepMind показала Gemini Robotics ER 2 — мультимодальную модель для робототехники, которая планирует действия по видео в реальном времени и умеет координировать несколько роботов. Подход «планировщик + исполнитель» обещает меньше зависаний в неожиданных ситуациях и больше пригодных для бизнеса сценариев.
Google DeepMind представила Gemini Robotics ER 2 — модель для робототехники, рассчитанную на работу в «живом» мире: с непрерывным видео, меняющимися условиями и задачами, где нельзя просто один раз составить план и надеяться, что всё пойдёт по сценарию.
Что именно показали
ER 2 позиционируют как решение для высокоуровневого планирования и управления задачами «в процессе», а не только на старте. Модель принимает мультимодальный вход (в первую очередь видеопоток) и строит последовательность действий, учитывая, что в кадре постоянно что-то меняется.
Важно, что ER 2 — это не «одна модель делает всё». DeepMind делает акцент на архитектуре, где логика и моторика разделены: ER 2 выступает как планировщик, а низкоуровневое выполнение передаётся отдельным инструментам управления и специализированным моделям класса Vision-Language-Action (VLA).
Почему это может быть полезно на практике
Одна из типичных проблем роботов в реальных условиях — «ломание» сценария от мелочей. Например, предмет лежит не там, где ожидали, кто-то прошёл рядом, объект частично перекрыт, или робот сделал действие, но результат оказался не тем.
В ER 2 заявлен фокус на понимании прогресса: модель анализирует видеопоток и пытается определить, на каком этапе находится задача, а также когда именно произошло значимое событие (например, объект поднят, дверь открыта, деталь встала на место). Это нужно, чтобы робот мог не просто «выполнить шаги», а корректировать поведение по факту происходящего.
- Меньше пауз на «подумать»: идея в том, что планирование следующего шага может идти параллельно текущему выполнению.
- Больше устойчивости к сбоям: если действие не сработало, система быстрее замечает расхождение и перестраивает поведение.
- Проще строить сложные процессы: вместо жёстких скриптов появляется слой смыслового управления задачей.
Работа в команде: несколько роботов в одной задаче
Отдельно заявлена поддержка сценариев, где задействовано несколько устройств: роботы могут обмениваться семантическим контекстом и совместно выполнять многошаговые задачи. В демонстрациях упоминаются примеры с роботами Boston Dynamics Spot.
Для разработчиков опубликованы стартовые примеры, чтобы попробовать модель в собственных сценариях и быстрее собрать прототип: например, распределение ролей между роботами (наблюдатель/исполнитель), синхронизация этапов и передача контекста между участниками.
Где это доступно и как встроено в экосистему
ER 2 уже доступна через Gemini API и Google AI Studio, а для корпоративной платформы агентных решений заявлен приватный превью-доступ. Также отмечается интеграция со стриминговой архитектурой Gemini Live API — это важно для робототехники, где задержки напрямую влияют на безопасность и качество выполнения.
Что это меняет для «обычных» сценариев
Если упростить, то ставка делается на связку: одна крупная модель понимает задачу и ситуацию, а дальше «раздаёт поручения» инструментам, которые умеют аккуратно и предсказуемо двигать робота.
В прикладных кейсах это может ускорить появление роботов, которые:
- подстраиваются под изменение обстановки (склад, магазин, производство);
- могут доводить задачу до конца без постоянного «перезапуска сценария» оператором;
- лучше объясняют, что происходит: какой этап сейчас, что пошло не так и почему принято новое решение.
При этом реальная ценность будет зависеть от того, насколько стабильно ER 2 ведёт себя на «грязном» видео, в сложном освещении и при нестандартных объектах — то есть там, где роботы чаще всего и спотыкаются.
