Alibaba выпустила модель Qwen-Audio-3.0-TTS с поддержкой 16 языков, эмоциональными тегами и функцией клонирования голоса.
Alibaba выпустила Qwen-Audio-3.0-TTS - новую модель для синтеза речи
Доступны две версии:
*
Flash - для голосовых интерфейсов в реальном времени
*
Plus - для генерации с упором на естественность и точную передачу тембра
Модель поддерживает 16 языков, включая русский. Стиль речи можно задавать обычным текстом: например, попросить читать медленно, спокойно или как сказку перед сном.
В текст также встраиваются управляющие теги:
[angry],
[whispers],
[laughing],
[sighing] и другие. Всего добавлено 86 тегов для управления эмоциями, темпом и неречевыми звуками.
Qwen-Audio-3.0-TTS умеет клонировать голос даже по шумной записи и генерировать до трёх минут аудио за один проход. Версия Plus сейчас занимает первое место в рейтинге Artificial Analysis TTS Arena.
Блог и примеры:
https://funaudiollm.github.io/qwen-audio-3.0-tts/
Документация API:
https://www.alibabacloud.com/help/en/model-studio/realtime-tts-user-guide Кратко (AI)
Компания Alibaba представила новую модель синтеза речи Qwen-Audio-3.0-TTS, доступную в версиях Flash и Plus. Модель поддерживает 16 языков, включая русский, позволяет управлять эмоциями через специальные теги и способна клонировать голос по шумным записям.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖