← к ленте

NVIDIA выпустила компактную модель Cosmos 3 Edge

1 мес

NVIDIA представила Cosmos 3 Edge — компактную модель мира на 4 млрд параметров для робототехники и компьютерного зрения.

🌟 NVIDIA выложила в открытый доступ Cosmos 3 Edge Это компактная модель мира на 4 миллиарда параметров, ориентированная на робототехнику, компьютерное зрение и автономный транспорт. Модель принимает на вход текст, картинки, видео и траектории движения, а на выходе выдаёт видео, изображения, текст и команды для действий. Внутри архитектура Mixture-of-Transformers, где авторегрессионная часть отвечает за рассуждения, а диффузионная за генерацию изображения, звука и действий. Отсюда двойное назначение, модель может и разбирать сцену, и генерировать движения для робота. NVIDIA заявляет, что среди моделей такого же размера Cosmos 3 Edge - первая в бенче VANTAGE-Bench на видеоаналитику и лучшая в обучении управляющих алгоритмов для роботов. Вместе с базовой версией в релиз вошли Cosmos 3 Edge Policy для манипуляций роботом и облегчённые 4-х шаговые версии Cosmos 3 Super (Image2Video и Text2Image), дистиллированные из старшей версии через DMD2. Edge - самое компактное звено семейства Cosmos 3, которое NVIDIA развивает с весны. Ранее были представлены более крупные модели Cosmos 3 Nano на 16 млрд параметров и Cosmos 3 Super на 64 млрд, плюс отдельные версии Super для генерации изображений по тексту и видео по одному кадру. Задачи у них те же - разобрать сцену, предсказать, что изменится, и сгенерировать действие, но рассчитаны они на более мощное оборудование. Edge же закрывает нижний край линейки и сделаны для устройств, где вычислительных ресурсов мало. 📌Лицензирование: OpenMDW License 🟡Статья 🟡Страница проекта 🟡Набор моделей 🟡Демо 🖥GitHub @ai_machinelearning_big_data #AI #ML #WordModel #Omnimodal #Cosmos3 #NVIDIA

Кратко (AI)

NVIDIA выпустила Cosmos 3 Edge, компактную модель мира на 4 млрд параметров, предназначенную для робототехники и автономных систем. Модель использует архитектуру Mixture-of-Transformers и способна обрабатывать мультимодальные данные для генерации действий и анализа сцен на устройствах с ограниченными ресурсами.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖