Wan Team (Alibaba) выпустила версию v0.2 экспериментальной модели Wan-Streameri — системы для общения с AI-аватаром в реальном времени, которая одновременно «видит», «слышит», «думает», говорит и генерирует видео прямо во время стрима.
Основное изменение — рост разрешения с 192×336 до 640×368 при сохранении прежней скорости генерации (25 FPS), а также расширение формата: теперь модель работает не только с крупными планами говорящих лиц, но и со сценами среднего плана, где важна общая картина взаимодействия — мимика, взгляд, жесты рук и контекст остаются различимыми в реальном времени.
640×368новое разрешение видео в v0.2
192×336разрешение предыдущей версии
25 FPSчастота кадров в реальном времени
- Для повышения разрешения без потери скорости переработали архитектуру генератора латентных представлений для мульти-GPU
- Проект называют «ответочкой» Runway Charactersi — конкурирующему решению для AI-аватаров
- Код и веса модели по-прежнему не опубликованы, разработчики не дают никакой информации о планах их релиза
- Модель позволяет вести диалог со сценой в среднем плане, а не только с крупным планом лица, включая нестандартные образы — например, аватар в виде пса
- Материалы и демо доступны по адресам wan-streamer.com/v0.2/ и в блоге tongyilab.substack.com
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖