← к ленте

Alibaba представила модель синтеза речи Qwen-Audio-3.0-TTS

1 мес

Alibaba выпустила модель Qwen-Audio-3.0-TTS с поддержкой 16 языков, эмоциональными тегами и функцией клонирования голоса.

Alibaba выпустила Qwen-Audio-3.0-TTS - новую модель для синтеза речи Доступны две версии: * Flash - для голосовых интерфейсов в реальном времени * Plus - для генерации с упором на естественность и точную передачу тембра Модель поддерживает 16 языков, включая русский. Стиль речи можно задавать обычным текстом: например, попросить читать медленно, спокойно или как сказку перед сном. В текст также встраиваются управляющие теги: [angry], [whispers], [laughing], [sighing] и другие. Всего добавлено 86 тегов для управления эмоциями, темпом и неречевыми звуками. Qwen-Audio-3.0-TTS умеет клонировать голос даже по шумной записи и генерировать до трёх минут аудио за один проход. Версия Plus сейчас занимает первое место в рейтинге Artificial Analysis TTS Arena. Блог и примеры: https://funaudiollm.github.io/qwen-audio-3.0-tts/ Документация API: https://www.alibabacloud.com/help/en/model-studio/realtime-tts-user-guide

Кратко (AI)

Компания Alibaba представила новую модель синтеза речи Qwen-Audio-3.0-TTS, доступную в версиях Flash и Plus. Модель поддерживает 16 языков, включая русский, позволяет управлять эмоциями через специальные теги и способна клонировать голос по шумным записям.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖