← к умной ленте

Alibaba выпустила Qwen-Audio-3.0-TTS — новую модель синтеза речи с поддержкой русского языка

Alibaba представила Qwen-Audio-3.0-TTSi — модель синтеза речи в двух версиях: Flash (для голосовых интерфейсов в реальном времени) и Plus (для генерации с упором на естественность и точную передачу тембра). Модель поддерживает 16 языков, включая русский, умеет клонировать голос по образцу и заняла 1-е место в рейтинге Artificial Analysis TTS Leaderboardi (версия Plus).

Голосом можно управлять как обычными текстовыми инструкциями («читай медленно», «как сказку перед сном», «голосом ведущей утреннего радио»), так и с помощью 86 встроенных тегов эмоций и звуков — например [angry], [whispers], [laughing], [sighing], [breaths]. Модель пока не выложена в open source, доступ продаётся через Alibaba Cloud.

16поддерживаемых языков
86тегов эмоций и звуков
3 минутымаксимум аудио за один проход
  • Клонирование голосаi работает даже по шумной, гулкой или плохо записанной аудиозаписи
  • За один проход модель генерирует до трёх минут аудио
  • По данным Source 3, тембр голоса сохраняется при генерации речи на другом языке, а качество аудио — до 48 кГц
  • По данным Source 4, частота дискретизации — 24 kHz, задержка генерации — около 1–2 сек на фразу; заявлена совместимость с ComfyUI, vits и rvc-пайплайнами
  • По данным Source 2, первый пакет аудио в режиме Flash формируется примерно за 300 мс
  • Рейтинг Artificial Analysis тестирует преимущественно американские и британские английские голоса — качество работы модели с русским языком независимыми тестами пока не подтверждено
  • Модель встроена в семейство Qwen-LLM; открытого исходного кода (open source) для неё, по имеющимся данным, нет

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖