TurboVLA: компактная модель управления роботами без LLM
N@neurohiveAI-инженер
3 недИсследователи представили TurboVLA — эффективную модель для роботов, которая заменяет LLM на BERT, достигая высокой скорости и точности при малом размере.
Новый подход к управлению роботами позволяет им работать быстрее и на менее мощном оборудовании.
- Отказ от тяжелых языковых моделей (LLM) в пользу легких энкодеров снижает требования к железу.
- Модель работает в разы быстрее аналогов, что критично для реального времени.
- Технология позволяет запускать сложные задачи на обычном потребительском оборудовании, например, RTX 4090.
TurboVLA: робот получает команды в разы быстрее при 97% успешных выполнений благодаря замене LLM на BERT
Исследователи из Хуачжунского университета науки и технологий и Huawei опубликовали TurboVLA, компактную vision-language-action модель, которая выдаёт действия для робота за 31.2 мс на RTX 4090 и набирает 97.7% на бенчмарке для роботов LIBERO. Главное отличие от других VLA в том, что внутри нет LLM. Вместо неё лёгкий текстовый энкодер BERT, а картинка и инструкция обмениваются информацией напрямую через модуль кросс-внимания. Отсюда 0.2B параметров вместо миллиардов и меньше 1 ГБ видеопамяти при инференсе.
Обычно VLA-модели устроены так: робот получает картинку с камеры и текстовую инструкцию по типу «сложи три миски друг на друга». Визуальные признаки сначала проецируются в пространство токенов языковой модели, склеиваются с токенами инструкции, прогоняются через модель, и уже из её скрытых состояний декодируются действия. Этот путь обозначается как V → L → A: сначала зрение, затем язык, потом действие. Ключевое наблюдение исследователей простое: если в инструкции уже написано, что делать, то от текста нужно только подсказать, на какие визуальные детали смотреть. Вместо V → L → A авторы предлагают прямое отображение V + L → A. Картинки и инструкция кодируются независимо, потом обмениваются информацией напрямую, минуя большую языковую модель. За один прямой проход модель выдаёт сразу чанк из 12 шагов управления.
Результаты на бенчмарке для роботов LIBERO: TurboVLA набирает 97.7% в среднем при 0.2B параметров, 0.9 ГБ видеопамяти и 31.2 мс задержки. Для сравнения, модель π0.5 выдаёт 96.9% при 3.4B параметров, 12.8 ГБ и 93.6 мс. VLA-JEPA набирает 97.2% при 2.8B и 108.7 мс, CogVLA 97.4% при 8.3B и 115.5 мс. Среди лёгких моделей Evo-1 даёт 94.8% при 0.8B, VLA-Adapter 97.3% при 1.5B. На реальном роботе AgileX Piper модель проверили на четырёх задачах (взять валик, отодвинуть карту, нажать степлер, сложить три миски) и получила от 80% до 92.5% успеха, в каждой из них обойдя π0.5.
Симуляционную часть можно воспроизвести целиком: обучение и тесты шли на открытых датасетах LIBERO и RoboTwin 2.0 (для версии под RoboTwin брали визуальный энкодер побольше, там 0.4B параметров). Собственные данные использовали только для дообучения под реального робота. TurboVLA рассчитана на конкретные инструкции. Если попросить робота «приготовить завтрак», разбивать это на шаги будет нечем.
Код модели доступен на GitHub под лицензией Apache-2.0, веса выложены на Hugging Face.
#Stateoftheart
Кратко (AI)
Исследователи из Хуачжунского университета науки и технологий и Huawei представили TurboVLA — компактную модель для управления роботами, которая отказывается от использования LLM в пользу BERT. Благодаря архитектуре прямого отображения визуальных и текстовых данных, модель требует всего 0.2 млрд параметров и менее 1 ГБ видеопамяти, демонстрируя при этом высокую скорость работы и точность на бенчмарке LIBERO.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖