MOSS-VL: открытая визуально-языковая модель с реалтайм-стримингом
Н@GreenNeuralRobotsAI-инженер
1 недОбзор MOSS-VL, открытой VLM от OpenMOSS с поддержкой реалтайм-стриминга видео, 11B параметров и контекстом 256K.
Новый подход к обработке видео в реальном времени позволяет ИИ реагировать на события по мере их появления в кадре.
- Модель обрабатывает видеопоток «на лету», не дожидаясь завершения записи.
- Встроенные алгоритмы позволяют ИИ самостоятельно решать, когда отвечать, молчать или корректировать свои выводы.
- Технология снижает задержки при взаимодействии с визуальными данными.
MOSS-VL
Семейство открытых визуально-языковых моделей от OpenMOSS. Флагманская фишка - реалтайм-стриминг: модель смотрит на входящие кадры и отвечает параллельно, не дожидаясь конца видео
модель живёт в настоящем времени, а не смотрит запись постфактум. Вместо внешних планировщиков и опроса раз в секунду - три встроенных поведения: ответ в любой момент, проактивное молчание, своевременная коррекция.
• 11B параметров, контекст 256K
• Кванты FP8 и NF4
Гитхаб
HF
Демо
#vlm #realtime #fp8 #nf4 #dialog #interactive
VK | MAX
Кратко (AI)
OpenMOSS представили MOSS-VL, семейство открытых визуально-языковых моделей с поддержкой обработки видео в реальном времени. Модель способна анализировать входящий видеопоток параллельно с его получением, используя встроенные механизмы проактивного ответа и коррекции.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖