MiniMax выпустил открытую модель Music 3 для генерации 5-минутных музыкальных композиций с вокалом, использующую иерархическую архитектуру LLM.
⚡️
MiniMax Music 3: открытая модель генерации музыки с вокалом
MiniMax
опубликовал веса модели для создания полноценных композиций длиной до пяти минут, которая понимает музыкальную структуру и выдаёт на выходе 32 kHz стерео в формате 16-bit WAV.
Music 3 управляется промптом из текста песни (с тегами вида [Chorus] или [Solo]) и музыкальным описанием (жанр, BPM, тональность, лад и т.д.).
MiniMax советует разбивать промпт на метаданные, детали вокала и аранжировку, но если лень писать руками, можно прогнать запрос через специальный скилл music-caption-rewriter.
🟡
Механика
Под капотом иерархическая авторегрессионная архитектура из двух уровней. Global LLM отвечает за то, как трек устроен целиком, Local LLM - за то, как он звучит в каждый конкретный момент.
🟢
Global LLM: Qwen3-8B, у которой на этапе тренировки сделали дотюн эмбеддингов и выходных слоёв на семантические музыкальные токены. Держит структуру трека и кадр за кадром предсказывает первый RVQ codebook - семантический, на 16 384 записи.
🟢
Local LLM (0.6B): внутри каждого кадра достраивает оставшиеся 7 акустических кодбуков и возвращает мелкую акустическую детализацию.
Обычно звук декодируют прямо из дискретных RVQ токенов. Здесь вместо этого модуль синтеза сливает финальные скрытые состояния обеих LLM - они непрерывные, и в них остаётся больше информации об артикуляции вокала, текстуре инструментов и непрерывности во времени.
Дальше поток идёт по цепочке: слияние скрытых состояний → Flow Matching на 2.4B → латент Flow-VAE → декодер Flow-VAE на 123M → 32 kHz стерео. Дискретный декодер токенизатора на инференсе не нужен вовсе.
Flow-VAE взят из MiniMax Speech и переобучен под динамический диапазон и спектр музыки.
🟡
Доступность
Модель запускается в
SGLang,
HuggingFace Diffusers и
ComfyUI.
В полной точности она
влезает в 24 GB VRAM, с включённым автоматическим CPU offloading съест около 22 GB.
А если подрубить layer-by-layer streaming для языковой модели, то её вполне можно завести даже на карточках с 8 GB видеопамяти, но придётся ждать результата ощутимо дольше.
🟡
Ограничения
🟠Streaming generation сейчас вообще не поддерживается, модель отдаёт только готовый кусок.
🟠Входной промпт ограничен длиной в 5 000 токенов.
🟠Аудиовывод упирается в потолок из 9 000 акустических фреймов.
📌Лицензирование:
MiniMax-Music3 Community License
🟡
Страница проекта
🟡
Веса
🟡
Демо
🖥
GitHub
@ai_machinelearning_big_data
#AI #ML #TextToMusic #Music3 #MiniMax
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖