V-RAE: семантическое сжатие для видеогенераторов
Н@GreenNeuralRobotsAI-инженер
4 днИсследовательский проект V-RAE предлагает сжимать видео на основе смысла, а не пикселей, для ускорения и улучшения качества генерации.
Новый метод сжатия видео может значительно ускорить работу нейросетей-генераторов.
- Позволяет моделям быстрее обучаться за счет работы с высокоуровневыми смыслами.
- Улучшает качество генерации видео благодаря пониманию структуры сцены.
- Обеспечивает возможность сжатия видео по времени без потери ключевого содержания.
V-RAE
Тут предлагают строить сжатое представление видеогенераторов не на основе пикселей, а на основе смысла. Берут пониматоры видео и поверх них делают компактный слой. То есть образно говоря, вместо аудиозаписи нотная запись. В ней меньше деталей но видна видна структура, по которой можно сыграть заново даже лучше оригинала
- Генератору проще работать со смыслом, он сходится быстрее в разы и выдает лучшее качество
- Видео можно сжимать по времени без потери смысла
- Такое представление можно использовать не только для генерации, но и для предсказания следующих кадров
Веса есть но это исследовательский проект, а не прикладной
Гитхаб
HF
#research
VK | MAX
Кратко (AI)
Проект V-RAE представляет новый подход к сжатию видео для генеративных моделей, основанный на семантическом представлении данных вместо пиксельного. Это позволяет ускорить обучение моделей, улучшить качество генерации и эффективно работать с временной структурой видео.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖