Qwen-Video-Edit: редактирование видео через Image-Edit модели
М@cgeventAI-инженер
1 недРазбор архитектуры Qwen-Video-Edit, использующей Qwen-Image-Edit и Wan 2.2 для редактирования видео без обучения специализированных видео-трансформеров.
Новый подход к редактированию видео позволяет использовать существующие модели для изображений.
- Позволяет адаптировать мощные модели редактирования изображений для работы с видео.
- Использует комбинацию разных архитектур для достижения временной связности.
- Демонстрирует потенциал 'виртуальной сетки' кадров для обработки видео без обучения полноценных видео-трансформеров.
Qwen-Video(?)-Edit. Для гиков
Довольно остроумный проект. Не уверен, что это прям продакшн тул, но подход простой и красивый, поэтому распишу подробнее.
TLDR: Qwen-Video-Edit превращает Qwen-Image-Edit в видеоредактор, не обучая отдельный video transformer.
Они берут исходное видео, кодируют его через VAE от Wan 2.1, а получившиеся временные латенты скармливают Qwen-Image-Edit DiT почти как одну ОГРОМНУЮ картинку: кадры раскладываются в виртуальную сетку, а две небольшие обучаемые projection-прослойки переводят латенты Wan в пространство Qwen и обратно. После редактирования результат дополнительно прогоняется через несколько denoise-шагов Wan 2.2, чтобы улучшить качество и временную стабильность.
То есть на пальцах это:
video → Wan VAE → Qwen-Image-Edit → Wan VAE → Wan 2.2 enhancement → video
Длинное видео режется на куски по 45 кадров, причем каждому куску можно дать отдельную инструкцию. Сейчас опубликованный checkpoint обучен именно под 360p / 45 frames.
Код и веса есть, это все уже давно в сети:
Qwen-Image-Edit transformer - ~40 GB весов
Qwen text encoder + VAE/tokenizer - ~15 GB
Wan 2.1 VAE
Wan 2.2 A14B для финального enhancement - ~80 GB весов
Поэтому жоский оффлоад и тормоза.
Project page с примерами(https://yunpeng1998.github.io/Qwen-Video-Edit-Page/
На первый взгляд это должно приподвскипает, ибо Qwen-Image-Edit изначально не является temporal model.
Но они запихивают сразу пачку кадров в одно общее представление, поэтому Qwen видит их одновременно.
Однако это всё равно не означает настоящего temporal attention. Модель фактически должна сама догадаться, что две похожие морды в соседних участках latent-grid - это один и тот же человек через 40 мс.
Для этого они причаливают Wan 2.2 в конце.
В общем как идея отлично. Как инструмент - не знаю. Просто понравилось. Может кого-то вдохновит на безумные пайплайны.
@cgevent
Кратко (AI)
Проект Qwen-Video-Edit предлагает метод редактирования видео, адаптируя модель Qwen-Image-Edit для работы с видео-латентными представлениями. Система использует VAE от Wan 2.1 для кодирования кадров в сетку, которую обрабатывает Qwen, а затем применяет Wan 2.2 для улучшения качества и временной стабильности. Решение требует значительных вычислительных ресурсов из-за большого объема весов моделей.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖