← к ленте

Xiaomi представила MiDashengLM-Gen: генератор комплексных аудиосцен

1 нед

Команда MiLM Plus из Xiaomi выпустила опенсорс-модель MiDashengLM-Gen для генерации аудиосцен, объединяющую речь, музыку и звуковые эффекты.

Появление новых инструментов для создания комплексного аудиоконтента упрощает работу с озвучкой и звуковыми эффектами.

  • Позволяет генерировать полноценные аудиосцены с фоновыми шумами и музыкой в одном промпте.
  • Модель распространяется по лицензии Apache 2.0, что делает её доступной для разработчиков.
  • Улучшенная разборчивость речи по сравнению с предыдущими версиями.
🌟 MiDashengLM-Gen: генерация комплексных звуковых сцен Команда MiLM Plus из Xiaomi опенсорснула генератор звука по текстовому описанию, который создаёт целостные аудиосцены из речи, музыки, звуковых эффектов и фоновой акустики окружающей среды. Под капотом - собственный аудиотокенизатор MiDashengLM-0.6B, построенный по архитектуре DashengTokenizer, и дообученная языковая модель Qwen3-1.7B, работающие в связке с Flow matching на базе DiT. Данные для обучения из двух источников: первый - приватный суперсет ACAVCaps на 77 тысяч часов с речью, музыкой и эффектами, второй - микс TTS-корпусов Emilia, LibriTTS, LJSpeech, AISHELL-3, WenetSpeech4TTS. Русский язык модель знает, в речевой части ACAVCaps его доля 4,66%, но основа обучения всё же английский (54%) и китайский (24,5%). В TTS-сетах русского нет вообще, и это видно по качеству (13,19% ошибок против 2,42% на английском). Управление в промпте задаётся тегами: <|caption|> - описание всей сцены; <|asr|> - текст для озвучки голосом; <|speech|> - тон, эмоции, стиль голоса; <|sfx|> - звуковые эффекты; <|music|> - описание музыки; <|env|> - окружающая среда. Указывать нужно все, а если поле неприменимо, туда идёт <|unknown|>. У чистой речи, например, заглушки стоят в полях музыки и эффектов. Смысл в том, чтобы управляющие факторы не слипались друг с другом. Модель видит явное разделение и не пытается вывести стиль говорящего из описания фонового шума. На выходе - трек в формате WAV с частотой дискретизации 16 кГц. Длина ограничена до 20 секунд, на более длинных таймингах модель не проверяли. 🟡Тесты
Прямых аналогов среди открытых моделей почти нет, поэтому авторы сопоставляют систему с узкоспециализированными по каждой задаче и со своим же предшественником Dasheng AudioGen.
Основная причина для гордости - разборчивость речи. На английском Seed-TTS доля ошибок упала с 12,15% до 2,79%. Мультиязычность тоже подтянулась, но до уровня Qwen3-TTS и Seed-TTS система не дотягивает. Вин-стрик по эмоциям на CV3-Eval, где эмоция подсказана текстом, - 0,98 радость, 0,96 грусть, 0,92 злость. По генерации отдельных звуков в AudioCaps система уступает TangoFlux (FAD 5,01 против 2,26).
В планах - клонирование голоса, подтягивание низкоресурсных языков и управление по времени.
📌Лицензирование: Apache 2.0 License 🟡Страница проекта 🟡Веса 🟡Arxiv 🟡Демо 🖥GitHub @ai_machinelearning_big_data #AI #ML #TTA #TTS #TTSFX #MiDashengLM #Xiaomi
Xiaomi представила MiDashengLM-Gen: генератор комплексных аудиосцен

Кратко (AI)

Команда Xiaomi MiLM Plus представила открытую модель MiDashengLM-Gen, способную генерировать целостные аудиосцены, включая речь, музыку и звуковые эффекты. Модель базируется на архитектуре Qwen3-1.7B и собственном аудиотокенизаторе, поддерживая управление через специальные теги для разделения звуковых слоев.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖