Alibaba представила модель синтеза речи Qwen Audio 3.0 TTS
G@aiofthedayAI-инженер
1 месAlibaba анонсировала Qwen Audio 3.0 TTS: синтез речи на 16 языках, клонирование голоса и лидерство в рейтинге Artificial Analysis.
Alibaba представила Qwen Audio 3.0 TTS для синтеза речи
Qwen Audio 3.0 TTS озвучивает текст на 16 языках, включая русский. Умеет копировать голос по аудиопримеру. Тембр сохраняется при генерации речи на другом языке. В Artificial Analysis TTS Leaderboard модель заняла 1-е место.
Голосом можно управлять обычными инструкциями. Например, попросить говорить быстрее, тише, испуганно или голосом ведущей утреннего радио. Ещё добавили 86 тегов для точной настройки отдельных фраз.
За один проход модель может озвучить до трёх минут текста. Она также справляется с шумными, гулкими и плохо записанными образцами голоса и выдаёт аудио в качестве до 48 кГц.
Модель пока не выложили в open source. Доступ продают в Alibaba Cloud.
https://funaudiollm.github.io/qwen-audio-3.0-tts/
Кратко (AI)
Компания Alibaba представила модель Qwen Audio 3.0 TTS, способную синтезировать речь на 16 языках с поддержкой клонирования голоса и эмоциональной настройки. Модель возглавила рейтинг Artificial Analysis и доступна для использования через облачную платформу Alibaba Cloud.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖