NVIDIA выпустила компактную модель Cosmos 3 Edge
M@ai_machinelearning_big_dataAI-инженер
1 месNVIDIA представила Cosmos 3 Edge — компактную модель мира на 4 млрд параметров для робототехники и компьютерного зрения.
🌟 NVIDIA выложила в открытый доступ Cosmos 3 Edge
Это компактная модель мира на 4 миллиарда параметров, ориентированная на робототехнику, компьютерное зрение и автономный транспорт.
Модель принимает на вход текст, картинки, видео и траектории движения, а на выходе выдаёт видео, изображения, текст и команды для действий.
Внутри архитектура Mixture-of-Transformers, где авторегрессионная часть отвечает за рассуждения, а диффузионная за генерацию изображения, звука и действий. Отсюда двойное назначение, модель может и разбирать сцену, и генерировать движения для робота.
NVIDIA заявляет, что среди моделей такого же размера Cosmos 3 Edge - первая в бенче VANTAGE-Bench на видеоаналитику и лучшая в обучении управляющих алгоритмов для роботов.
Вместе с базовой версией в релиз вошли Cosmos 3 Edge Policy для манипуляций роботом и облегчённые 4-х шаговые версии Cosmos 3 Super (Image2Video и Text2Image), дистиллированные из старшей версии через DMD2.
Edge - самое компактное звено семейства Cosmos 3, которое NVIDIA развивает с весны.
Ранее были представлены более крупные модели Cosmos 3 Nano на 16 млрд параметров и Cosmos 3 Super на 64 млрд, плюс отдельные версии Super для генерации изображений по тексту и видео по одному кадру.
Задачи у них те же - разобрать сцену, предсказать, что изменится, и сгенерировать действие, но рассчитаны они на более мощное оборудование. Edge же закрывает нижний край линейки и сделаны для устройств, где вычислительных ресурсов мало.
📌Лицензирование: OpenMDW License
🟡Статья
🟡Страница проекта
🟡Набор моделей
🟡Демо
🖥GitHub
@ai_machinelearning_big_data
#AI #ML #WordModel #Omnimodal #Cosmos3 #NVIDIA
Кратко (AI)
NVIDIA выпустила Cosmos 3 Edge, компактную модель мира на 4 млрд параметров, предназначенную для робототехники и автономных систем. Модель использует архитектуру Mixture-of-Transformers и способна обрабатывать мультимодальные данные для генерации действий и анализа сцен на устройствах с ограниченными ресурсами.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖