🌟
MiDashengLM-Gen: генерация комплексных звуковых сцен
Команда MiLM Plus из Xiaomi опенсорснула
генератор звука по текстовому описанию, который создаёт целостные аудиосцены из речи, музыки, звуковых эффектов и фоновой акустики окружающей среды.
Под капотом - собственный аудиотокенизатор MiDashengLM-0.6B, построенный по архитектуре
DashengTokenizer, и дообученная языковая модель Qwen3-1.7B, работающие в связке с Flow matching на базе DiT.
Данные для обучения из двух источников: первый - приватный суперсет ACAVCaps на 77 тысяч часов с речью, музыкой и эффектами, второй - микс TTS-корпусов Emilia, LibriTTS, LJSpeech, AISHELL-3, WenetSpeech4TTS.
Русский язык модель знает, в речевой части ACAVCaps его доля 4,66%, но основа обучения всё же английский (54%) и китайский (24,5%). В TTS-сетах русского нет вообще, и это видно по качеству (13,19% ошибок против 2,42% на английском).
Управление в промпте
задаётся тегами:
<|caption|> - описание всей сцены;
<|asr|> - текст для озвучки голосом;
<|speech|> - тон, эмоции, стиль голоса;
<|sfx|> - звуковые эффекты;
<|music|> - описание музыки;
<|env|> - окружающая среда.
Указывать нужно все, а если поле неприменимо, туда идёт
<|unknown|>. У чистой речи, например, заглушки стоят в полях музыки и эффектов.
Смысл в том, чтобы управляющие факторы не слипались друг с другом. Модель видит явное разделение и не пытается вывести стиль говорящего из описания фонового шума.
На выходе - трек в формате WAV с частотой дискретизации 16 кГц. Длина ограничена до 20 секунд, на более длинных таймингах модель не проверяли.
🟡
Тесты
Прямых аналогов среди открытых моделей почти нет, поэтому авторы сопоставляют систему с узкоспециализированными по каждой задаче и со своим же предшественником Dasheng AudioGen.
Основная причина для гордости - разборчивость речи. На английском Seed-TTS доля ошибок упала с 12,15% до 2,79%. Мультиязычность тоже подтянулась, но до уровня Qwen3-TTS и Seed-TTS система не дотягивает.
Вин-стрик по эмоциям на CV3-Eval, где эмоция подсказана текстом, - 0,98 радость, 0,96 грусть, 0,92 злость.
По генерации отдельных звуков в AudioCaps система уступает TangoFlux (FAD 5,01 против 2,26).
В планах - клонирование голоса, подтягивание низкоресурсных языков и управление по времени.
📌Лицензирование: Apache 2.0 License
🟡
Страница проекта
🟡
Веса
🟡
Arxiv
🟡
Демо
🖥
GitHub
@ai_machinelearning_big_data
#AI #ML #TTA #TTS #TTSFX #MiDashengLM #Xiaomi