← к ленте

Google DeepMind представили Gemini Robotics 2

D@data_secretsAI-инженер
4 нед

Google DeepMind анонсировали Gemini Robotics 2: VLA-модель для управления всем телом гуманоида, оркестратор ER 2 и облегченную версию для локального инференса.

Google делает роботов более универсальными и способными к сложному взаимодействию с миром.

  • Роботы учатся управлять всем телом, включая мелкую моторику пальцев.
  • Модели теперь могут координировать работу нескольких разных роботов одновременно.
  • Упрощен процесс обучения: для адаптации модели к новому роботу требуется всего несколько часов и около 200 примеров.
Google DeepMind представили Gemini Robotics 2 С релиза версии 1.5 прошел почти год. Довольно долгий перерыв по сегодняшим меркам. Посмотрим, чего Google добились за это время. Самое важное: VLA-модель, которая лежит в основе, впервые управляет полным телом гуманоида от стоп до пальцев рук, а не только верхней частью корпуса. При этом у рук моторика достаточно мелкая, 22 степени свободы. Нельзя сказать, что робот получается супер-ловким (success rate на multi-finger задачах в районе 30-40%), но это прогресс. Поверх VLA-модели также работает оркестратор Gemini Robotics ER 2. Это отдельная модель поколения, и тут уже просто VLM. То есть, если у VLA на выходе готовые моторные команды, то ER – это более высокий уровень, но котором выполняется ризонинг, разбиение задачи на подзадачи, распознавание объектов и их координат и прочая "интеллектуальная" работа. Эту модель тоже существенно прокачали и добавили ей киллер-фичу в виде способности координировать работу сразу нескольких разнотипных роботов для выполнения одной задачи. Кроме того, теперь ER может вмешиваться в действия VLA на любом этапе выполнения задачи, что критично для self-correction. Еще в поколении появилась модель Gemini Robotics On-Device 2 – облегченная VLA для локального инференса. Основное отличие Gemini Robotics – универсальность. Модели обучают на гетерогенных мультиэмбодимент-данных, поэтому они могут работать на роботах самых разных типов без тюнинга. Так вот GR2 On-Device выводит это свойство на практический уровень: вы можете взять эту модель и буквально за несколько часов и ~200 демонстраций заставить ее хорошо работать на любом новом теле (с кастомными сенсорами, DoF, кинематикой и тд). https://deepmind.google/blog/gemini-robotics-2-brings-whole-body-intelligence-to-robots/ А еще из забавного: Google сделали первый бенчмарк для оценки безопасности роботов и назвали его ASIMOV-Agentic. Свою модель они, естественно, заявили как "самую безопасную в мире" по этому тесту ☕️

Кратко (AI)

Google DeepMind представили второе поколение моделей Gemini Robotics. Основные новшества включают VLA-модель для управления всем телом робота, оркестратор ER 2 для координации нескольких устройств и облегченную версию On-Device 2 для быстрой адаптации к новому оборудованию.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖