Обзор новой open-weight модели MiniMax Music 3 для генерации песен с вокалом, её архитектуры, требований к железу и интеграции в ComfyUI.
Minimax Music 3. Open Source!!
Музыкальная тема не отпускает, будем жечь дальше, хотя там вышла Gemini 2.7 Flash и GLM 5.3
Их позже обсудим.
Для ботов: ACE < Minimax < Suno.
Для тех, кто физическим не может в длинные тексты: MiniMax Music 3 - новая локальная open-weight модель, которая уже завелась в ComfyUI и умеет генерировать длинные полноценные песни с вокалом. Под капотом гибрид: 8B LLM на базе Qwen3-8B держит структуру трека, 0.6B LLM занимается локальными деталями, а Flow Matching + Flow-VAE превращают это в аудио. Seed рулить можно, а привычных diffusion steps в официальном workflow пока нет.
Теперь для гиков.
Технически MiniMax Music 3 устроен заметно интереснее обычных audio-token моделей. Под капотом гибридная схема:
8B LLM на базе Qwen3-8B отвечает за длинную структуру трека, развитие куплетов, припевов и общую музыкальную логику; отдельный
0.6B LLM дорисовывает более локальные, покадровые акустические детали. После этого звук не декодируется напрямую из токенов: объединенные hidden states идут в
2.4B Flow Matching-модуль + Flow-VAE, которые уже синтезируют финальное аудио.
Уже есть поддержка ComfyUI
Официальный workflow MiniMax Music 3 сейчас выводит такие основные параметры:
-
Caption - стиль, BPM, тональность, вокал, инструменты, аранжировка
-
Lyrics - текст + структурные теги
[Intro],
[Verse],
[Chorus],
[Bridge],
[Solo],
[Outro] и т.д.
-
max_duration - длительность, до примерно
300 секунд
-
`seed` - есть.
-
tiled_decode - экономия VRAM при декодировании длинных треков.
Steps: в официальной документации среди контролируемых параметров их вообще нет. Это не обычный KSampler, где ты выставляешь 20/30/50 steps. Архитектура смешанная: 8B autoregressive Global LLM + 0.6B Local LLM + 2.4B Flow Matching + Flow-VAE. То есть часть генерации вообще идет авторегрессионно.
Самое главное: железо
Не так все плохо, однако.
MiniMax официально пишет:
- full precision помещается
менее чем в 24 GB VRAM
- с automatic CPU offload расход GPU около
22 GB
- с layer-by-layer streaming можно запустить даже на
8 GB VRAM, но заметно медленнее.
Для ComfyUI уже есть три чекпойнта(на момент написания):
-
minimax_music3_dit_fp16.safetensors
-
minimax_music3_dit_int8_convrot.safetensors
-
minimax_music3_text_encoder_pruned_int8_convrot.safetensors
Плюс отдельный VAE. Comfy прямо рекомендует
INT8 + tiled decode для длинных песен на картах с нищебродской VRAM.
Скорость
140 секунд музыки за примерно 125 секунд генерации в r/comfyui. То есть примерно около realtime(!!!!).
Очень круто: длительность не абсолютно жесткая. У MiniMax авторегрессионная часть умеет выдать end-of-audio раньше лимита. В API
max_new_tokens ограничивает максимум аудиофреймов, причем модель может закончить песню раньше. В ComfyUI
max_duration работает аналогично как целевая/максимальная длительность.
Плюсы:
- вокал заметно лучше большинства предыдущих локальных/open моделей
- композиции действительно похожи на законченные песни, а не на двухминутные бесконечные лупы
- длинная структура держится прилично
Минусы:
Пока это в основном
Text-to-Music.
Нет нормального:
- audio reference
- song-to-song
- cover/remix существующего трека
- extend собственного аудио
- replace section/inpaint
- reference style через загруженный трек.
И непонятки с обучением.
А вот с промптами все нарядно - Structured Caption из трех частей:
1. Global Metadata - жанр, subgenre, BPM, key, scale, эмоциональная дуга, production profile.
2. Vocal Details - пол, тембр, манера, backing vocals, harmonies, эффекты.
3. Arrangement - инструменты, развитие по секциям, groove, bass, percussion, spatial FX.
И отдельно lyrics с секционными тегами.
Ссылки:
https://docs.comfy.org/tutorials/audio/minimax/minimax-music-3
https://huggingface.co/MiniMaxAI/MiniMax-Music3
https://huggingface.co/Comfy-Org/MiniMax-Music-3
https://github.com/Comfy-Org/workflow_templates/blob/main/templates/audio_minimax_music_3.json
https://github.com/Comfy-Org/ComfyUI/pull/15570
https://www.reddit.com/r/comfyui/comments/1vni9fq/minimax_music_3_is_live_in_comfyui_enjoy_state_of/
@cgevent
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖