Google DeepMind представили Gemini Robotics 2
D@data_secretsAI-инженер
4 недGoogle DeepMind анонсировали Gemini Robotics 2: VLA-модель для управления всем телом гуманоида, оркестратор ER 2 и облегченную версию для локального инференса.
Google делает роботов более универсальными и способными к сложному взаимодействию с миром.
- Роботы учатся управлять всем телом, включая мелкую моторику пальцев.
- Модели теперь могут координировать работу нескольких разных роботов одновременно.
- Упрощен процесс обучения: для адаптации модели к новому роботу требуется всего несколько часов и около 200 примеров.
Google DeepMind представили Gemini Robotics 2
С релиза версии 1.5 прошел почти год. Довольно долгий перерыв по сегодняшим меркам. Посмотрим, чего Google добились за это время.
Самое важное: VLA-модель, которая лежит в основе, впервые управляет полным телом гуманоида от стоп до пальцев рук, а не только верхней частью корпуса. При этом у рук моторика достаточно мелкая, 22 степени свободы. Нельзя сказать, что робот получается супер-ловким (success rate на multi-finger задачах в районе 30-40%), но это прогресс.
Поверх VLA-модели также работает оркестратор Gemini Robotics ER 2. Это отдельная модель поколения, и тут уже просто VLM. То есть, если у VLA на выходе готовые моторные команды, то ER – это более высокий уровень, но котором выполняется ризонинг, разбиение задачи на подзадачи, распознавание объектов и их координат и прочая "интеллектуальная" работа.
Эту модель тоже существенно прокачали и добавили ей киллер-фичу в виде способности координировать работу сразу нескольких разнотипных роботов для выполнения одной задачи. Кроме того, теперь ER может вмешиваться в действия VLA на любом этапе выполнения задачи, что критично для self-correction.
Еще в поколении появилась модель Gemini Robotics On-Device 2 – облегченная VLA для локального инференса.
Основное отличие Gemini Robotics – универсальность. Модели обучают на гетерогенных мультиэмбодимент-данных, поэтому они могут работать на роботах самых разных типов без тюнинга. Так вот GR2 On-Device выводит это свойство на практический уровень: вы можете взять эту модель и буквально за несколько часов и ~200 демонстраций заставить ее хорошо работать на любом новом теле (с кастомными сенсорами, DoF, кинематикой и тд).
https://deepmind.google/blog/gemini-robotics-2-brings-whole-body-intelligence-to-robots/
А еще из забавного: Google сделали первый бенчмарк для оценки безопасности роботов и назвали его ASIMOV-Agentic. Свою модель они, естественно, заявили как "самую безопасную в мире" по этому тесту ☕️
Кратко (AI)
Google DeepMind представили второе поколение моделей Gemini Robotics. Основные новшества включают VLA-модель для управления всем телом робота, оркестратор ER 2 для координации нескольких устройств и облегченную версию On-Device 2 для быстрой адаптации к новому оборудованию.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖