Alibaba представила Qwen-Audio-3.0-TTSi — модель синтеза речи в двух версиях: Flash (для голосовых интерфейсов в реальном времени) и Plus (для генерации с упором на естественность и точную передачу тембра). Модель поддерживает 16 языков, включая русский, умеет клонировать голос по образцу и заняла 1-е место в рейтинге Artificial Analysis TTS Leaderboardi (версия Plus).
Голосом можно управлять как обычными текстовыми инструкциями («читай медленно», «как сказку перед сном», «голосом ведущей утреннего радио»), так и с помощью 86 встроенных тегов эмоций и звуков — например [angry], [whispers], [laughing], [sighing], [breaths]. Модель пока не выложена в open source, доступ продаётся через Alibaba Cloud.
16поддерживаемых языков
86тегов эмоций и звуков
3 минутымаксимум аудио за один проход
- Клонирование голосаi работает даже по шумной, гулкой или плохо записанной аудиозаписи
- За один проход модель генерирует до трёх минут аудио
- По данным Source 3, тембр голоса сохраняется при генерации речи на другом языке, а качество аудио — до 48 кГц
- По данным Source 4, частота дискретизации — 24 kHz, задержка генерации — около 1–2 сек на фразу; заявлена совместимость с ComfyUI, vits и rvc-пайплайнами
- По данным Source 2, первый пакет аудио в режиме Flash формируется примерно за 300 мс
- Рейтинг Artificial Analysis тестирует преимущественно американские и британские английские голоса — качество работы модели с русским языком независимыми тестами пока не подтверждено
- Модель встроена в семейство Qwen-LLM; открытого исходного кода (open source) для неё, по имеющимся данным, нет
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖