MiniMax опубликовал веса Music 3 — open-source модель, которая по текстовому промпту создаёт полноценные песни с вокалом, инструментами и структурой (куплет-припев) за один проход, длительностью до 5 минут (по данным одного источника — до 10 минут). Модель уже интегрирована в ComfyUIi, HuggingFace Diffusers и SGLang, работает локально и не требует топового железа.
В отличие от типичных audio-token генераторов, MiniMax использует гибридную архитектуру из двух LLM плюс модуль Flow Matching и Flow-VAEi, что даёт более гибкий контроль над структурой трека, вокалом и аранжировкой через отдельные seed и CFG для разных уровней генерации.
24 GBминимум VRAM для полной точности
8Bразмер Global LLM (Qwen3-8B)
32 kHzчастота дискретизации выходного аудио
- Архитектура: Global LLM на базе Qwen3-8B (дотюненный на музыкальные семантические токены) держит структуру трека и предсказывает первый RVQ-кодбукi из 16 384 записей; Local LLM на 0.6B внутри каждого кадра достраивает оставшиеся 7 акустических кодбуков
- Слитые скрытые состояния обеих LLM (непрерывные, без дискретизации) идут через Flow Matching-модуль на 2.4B в латент Flow-VAE, декодер которого (123M, взят из MiniMax Speech и переобучен под музыку) выдаёт финальный звук — 16-bit стерео WAV, 32 kHz
- Управление генерацией: текст песни с тегами [Intro], [Verse], [Chorus], [Bridge], [Solo], [Outro] плюс caption с жанром, BPM, тональностью, тембром вокала и аранжировкой; скилл music-caption-rewriter разворачивает короткий промпт в детальный
- Требования к железу: полная точность помещается в 24 GB VRAM, с автоматическим CPU offload — около 22 GB, а с layer-by-layer streaming языковой модели заявленный минимум — 8 GB
- В официальном ComfyUI-workflow AR-seed и DiT-seed связаны единым SeedNode, но их можно развязать; CFG для авторегрессионной части и для Flow/DiT-части настраиваются раздельно и заметно меняют звучание (например, AR CFG 2.5 + DiT CFG 1.0 против обратного сочетания); параметры temperature/top_p в официальном workflow пока отсутствуют
- По субъективной оценке одного из каналов, по качеству модели выстраиваются в ряд: ACE < Minimax < Suno
- Появился отдельный проект MiniMax Music 3.0 Studio — веб-обёртка над ComfyUI (React-интерфейс + Python-мост), которая собирает бриф (жанр, темп, тональность, эмоциональная арка), ставит задачу в очередь ComfyUI и выдаёт MP3 с библиотекой превью
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖