← к ленте

MOSS-VL: открытая визуально-языковая модель с реалтайм-стримингом

Н@GreenNeuralRobotsAI-инженер
1 нед

Обзор MOSS-VL, открытой VLM от OpenMOSS с поддержкой реалтайм-стриминга видео, 11B параметров и контекстом 256K.

Новый подход к обработке видео в реальном времени позволяет ИИ реагировать на события по мере их появления в кадре.

  • Модель обрабатывает видеопоток «на лету», не дожидаясь завершения записи.
  • Встроенные алгоритмы позволяют ИИ самостоятельно решать, когда отвечать, молчать или корректировать свои выводы.
  • Технология снижает задержки при взаимодействии с визуальными данными.
MOSS-VL Семейство открытых визуально-языковых моделей от OpenMOSS. Флагманская фишка - реалтайм-стриминг: модель смотрит на входящие кадры и отвечает параллельно, не дожидаясь конца видео модель живёт в настоящем времени, а не смотрит запись постфактум. Вместо внешних планировщиков и опроса раз в секунду - три встроенных поведения: ответ в любой момент, проактивное молчание, своевременная коррекция. • 11B параметров, контекст 256K • Кванты FP8 и NF4 Гитхаб HF Демо #vlm #realtime #fp8 #nf4 #dialog #interactive VK | MAX

Кратко (AI)

OpenMOSS представили MOSS-VL, семейство открытых визуально-языковых моделей с поддержкой обработки видео в реальном времени. Модель способна анализировать входящий видеопоток параллельно с его получением, используя встроенные механизмы проактивного ответа и коррекции.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖