← к ленте

Alibaba выпустила публичную бету модели Wan 3.0

М@cgeventAI-инженер
3 нед

Alibaba открыла публичную бету видеогенератора Wan 3.0 с поддержкой звука, длинных видео и мультимодальных референсов. Разбор цен и доступности.

Появление мощного конкурента в сфере генерации видео с поддержкой звука и сложных референсов.

  • Wan 3.0 позволяет создавать 30-секундные ролики с синхронизацией звука и видео.
  • Поддержка генерации видео из документов расширяет возможности для бизнес-презентаций.
  • Модель внедряется в экосистему Alibaba Cloud, что упрощает интеграцию для разработчиков.
Wan 3.0 в городе! Я уже писал про новые фичи тут. Ща про цены, доступ и рефы. Кратко: Alibaba официально открыла публичную бету Wan 3.0. Новая модель генерирует ролики со звуком продолжительностью до 30 секунд в 480p, 720p и 1080p. Также появились автоматический подбор длительности, продолжение готового видео и более стабильное сохранение персонажей, объектов и сцены на длинной дистанции. https://article.9466.com/news/aKweEQlm Цены API: 480p - около $0.04 за секунду 720p - около $0.08 за секунду 1080p - около $0.17 за секунду Таким образом, максимальный 30-секундный ролик стоит примерно $1.25 в 480p; $2.50 в 720p; около $5 в 1080p. Но: при использовании видео-референса Alibaba считает не только результат, но и длительность загруженного видео. Формула выглядит так: входное видео плюс сгенерированное видео. Например, 10-секундный референс и 30-секундный результат в 1080p обойдутся уже примерно в $6.70. Где доступен Ванский: модель уже появилась в Alibaba Cloud Model Studio, сервисе Wanjing Yike, на китайском сайте Wanxiang и в десктопном приложении Qwen Creation. В приложении Qwen доступ раздаётся постепенно, поэтому модель пока видят не все пользователи. API с идентификатором wan3.0-video уже внесён в каталоги регионов Beijing и Singapore, но пока помечен как invitation testing. Полностью открыть API Alibaba обещает позднее. Иными словами, публичная веб-бета уже началась, а свободного API-доступа для всех ещё нет. Что доступно в бете: помимо обычных text-to-video и image-to-video, Wan 3.0 принимает текст, изображения, аудио и видео в одной задаче. Alibaba обещает переносить из референсов лицо, причёску, телосложение, одежду, аксессуары, голос, логотипы, материалы предметов, расположение персонажей относительно камеры и общий визуальный стиль. Есть и странная функция генерации видео из документов: поддерживаются DOC, XLS, PPT, PDF, TXT, Keynote, Pages, Numbers и Markdown. Можно загрузить один файл или ссылку размером до 100 МБ и объёмом до 50 страниц. Что с количеством референсов: Alibabsky пока не назвал официального лимита для изображений, видео и аудио. Подтверждено только совместное использование разных типов референсов и заявленная консистентность персонажей, объектов, голоса, пространства и стиля. Ссылки: Цены и детали: https://x.com/Alibaba_Wan/status/2085339765860364601 Тут доступен: https://create.wan.video/generate Постепенно раскатывают Тарифы веб-сервиса: https://create.wan.video/pricing API: https://wan.video/api Китайский Wanxiang: https://tongyi.aliyun.com/wanxiang/videoCreation Alibaba Cloud Model Studio: https://bailian.console.aliyun.com/welcome Wanjing Yike: https://www.yikeai.com/ Qwen Creation: https://create.qianwen.com/ Клиент Qwen: https://www.qianwen.com/download Реддиторские уже заметили пропадающую речь и фон, переходящий в белый шум, странный липсинк и исчезающего на несколько секунд персонажа. Веса? Какие веса? Что такое веса? @cgevent

Кратко (AI)

Alibaba запустила публичную бету модели Wan 3.0, способной генерировать видео со звуком до 30 секунд. Модель поддерживает мультимодальные референсы, включая документы, и доступна через ряд сервисов компании, хотя API пока находится в режиме закрытого тестирования.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖