Alibaba выпустила публичную бету модели Wan 3.0
М@cgeventAI-инженер
3 недAlibaba открыла публичную бету видеогенератора Wan 3.0 с поддержкой звука, длинных видео и мультимодальных референсов. Разбор цен и доступности.
Появление мощного конкурента в сфере генерации видео с поддержкой звука и сложных референсов.
- Wan 3.0 позволяет создавать 30-секундные ролики с синхронизацией звука и видео.
- Поддержка генерации видео из документов расширяет возможности для бизнес-презентаций.
- Модель внедряется в экосистему Alibaba Cloud, что упрощает интеграцию для разработчиков.
Wan 3.0 в городе!
Я уже писал про новые фичи тут.
Ща про цены, доступ и рефы.
Кратко: Alibaba официально открыла публичную бету Wan 3.0. Новая модель генерирует ролики со звуком продолжительностью до 30 секунд в 480p, 720p и 1080p. Также появились автоматический подбор длительности, продолжение готового видео и более стабильное сохранение персонажей, объектов и сцены на длинной дистанции.
https://article.9466.com/news/aKweEQlm
Цены API:
480p - около $0.04 за секунду
720p - около $0.08 за секунду
1080p - около $0.17 за секунду
Таким образом, максимальный 30-секундный ролик стоит примерно $1.25 в 480p; $2.50 в 720p; около $5 в 1080p.
Но: при использовании видео-референса Alibaba считает не только результат, но и длительность загруженного видео. Формула выглядит так: входное видео плюс сгенерированное видео. Например, 10-секундный референс и 30-секундный результат в 1080p обойдутся уже примерно в $6.70.
Где доступен Ванский:
модель уже появилась в Alibaba Cloud Model Studio, сервисе Wanjing Yike, на китайском сайте Wanxiang и в десктопном приложении Qwen Creation. В приложении Qwen доступ раздаётся постепенно, поэтому модель пока видят не все пользователи. API с идентификатором wan3.0-video уже внесён в каталоги регионов Beijing и Singapore, но пока помечен как invitation testing. Полностью открыть API Alibaba обещает позднее. Иными словами, публичная веб-бета уже началась, а свободного API-доступа для всех ещё нет.
Что доступно в бете: помимо обычных text-to-video и image-to-video, Wan 3.0 принимает текст, изображения, аудио и видео в одной задаче. Alibaba обещает переносить из референсов лицо, причёску, телосложение, одежду, аксессуары, голос, логотипы, материалы предметов, расположение персонажей относительно камеры и общий визуальный стиль. Есть и странная функция генерации видео из документов: поддерживаются DOC, XLS, PPT, PDF, TXT, Keynote, Pages, Numbers и Markdown. Можно загрузить один файл или ссылку размером до 100 МБ и объёмом до 50 страниц.
Что с количеством референсов:
Alibabsky пока не назвал официального лимита для изображений, видео и аудио. Подтверждено только совместное использование разных типов референсов и заявленная консистентность персонажей, объектов, голоса, пространства и стиля.
Ссылки:
Цены и детали: https://x.com/Alibaba_Wan/status/2085339765860364601
Тут доступен: https://create.wan.video/generate
Постепенно раскатывают
Тарифы веб-сервиса: https://create.wan.video/pricing
API: https://wan.video/api
Китайский Wanxiang: https://tongyi.aliyun.com/wanxiang/videoCreation
Alibaba Cloud Model Studio: https://bailian.console.aliyun.com/welcome
Wanjing Yike: https://www.yikeai.com/
Qwen Creation: https://create.qianwen.com/
Клиент Qwen: https://www.qianwen.com/download
Реддиторские уже заметили пропадающую речь и фон, переходящий в белый шум, странный липсинк и исчезающего на несколько секунд персонажа.
Веса? Какие веса? Что такое веса?
@cgevent
Кратко (AI)
Alibaba запустила публичную бету модели Wan 3.0, способной генерировать видео со звуком до 30 секунд. Модель поддерживает мультимодальные референсы, включая документы, и доступна через ряд сервисов компании, хотя API пока находится в режиме закрытого тестирования.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖