← к ленте

Выход MiniMax Music 3: локальная open-weight модель для генерации музыки

М@cgeventAI-инженер
2 нед

Обзор новой open-weight модели MiniMax Music 3 для генерации песен с вокалом, её архитектуры, требований к железу и интеграции в ComfyUI.

Появление качественной локальной модели для создания музыки меняет доступность профессионального аудио-продакшена.

  • Позволяет генерировать полноценные песни с вокалом локально без подписки на облачные сервисы.
  • Поддержка ComfyUI упрощает интеграцию в рабочие процессы создателей контента.
  • Гибридная архитектура обеспечивает лучшее удержание структуры трека по сравнению с предыдущими open-source решениями.
Minimax Music 3. Open Source!! Музыкальная тема не отпускает, будем жечь дальше, хотя там вышла Gemini 2.7 Flash и GLM 5.3 Их позже обсудим. Для ботов: ACE < Minimax < Suno. Для тех, кто физическим не может в длинные тексты: MiniMax Music 3 - новая локальная open-weight модель, которая уже завелась в ComfyUI и умеет генерировать длинные полноценные песни с вокалом. Под капотом гибрид: 8B LLM на базе Qwen3-8B держит структуру трека, 0.6B LLM занимается локальными деталями, а Flow Matching + Flow-VAE превращают это в аудио. Seed рулить можно, а привычных diffusion steps в официальном workflow пока нет. Теперь для гиков. Технически MiniMax Music 3 устроен заметно интереснее обычных audio-token моделей. Под капотом гибридная схема: 8B LLM на базе Qwen3-8B отвечает за длинную структуру трека, развитие куплетов, припевов и общую музыкальную логику; отдельный 0.6B LLM дорисовывает более локальные, покадровые акустические детали. После этого звук не декодируется напрямую из токенов: объединенные hidden states идут в 2.4B Flow Matching-модуль + Flow-VAE, которые уже синтезируют финальное аудио. Уже есть поддержка ComfyUI Официальный workflow MiniMax Music 3 сейчас выводит такие основные параметры: - Caption - стиль, BPM, тональность, вокал, инструменты, аранжировка - Lyrics - текст + структурные теги [Intro], [Verse], [Chorus], [Bridge], [Solo], [Outro] и т.д. - max_duration - длительность, до примерно 300 секунд - `seed` - есть. - tiled_decode - экономия VRAM при декодировании длинных треков. Steps: в официальной документации среди контролируемых параметров их вообще нет. Это не обычный KSampler, где ты выставляешь 20/30/50 steps. Архитектура смешанная: 8B autoregressive Global LLM + 0.6B Local LLM + 2.4B Flow Matching + Flow-VAE. То есть часть генерации вообще идет авторегрессионно. Самое главное: железо Не так все плохо, однако. MiniMax официально пишет: - full precision помещается менее чем в 24 GB VRAM - с automatic CPU offload расход GPU около 22 GB - с layer-by-layer streaming можно запустить даже на 8 GB VRAM, но заметно медленнее. Для ComfyUI уже есть три чекпойнта(на момент написания): - minimax_music3_dit_fp16.safetensors - minimax_music3_dit_int8_convrot.safetensors - minimax_music3_text_encoder_pruned_int8_convrot.safetensors Плюс отдельный VAE. Comfy прямо рекомендует INT8 + tiled decode для длинных песен на картах с нищебродской VRAM. Скорость 140 секунд музыки за примерно 125 секунд генерации в r/comfyui. То есть примерно около realtime(!!!!). Очень круто: длительность не абсолютно жесткая. У MiniMax авторегрессионная часть умеет выдать end-of-audio раньше лимита. В API max_new_tokens ограничивает максимум аудиофреймов, причем модель может закончить песню раньше. В ComfyUI max_duration работает аналогично как целевая/максимальная длительность. Плюсы: - вокал заметно лучше большинства предыдущих локальных/open моделей - композиции действительно похожи на законченные песни, а не на двухминутные бесконечные лупы - длинная структура держится прилично Минусы: Пока это в основном Text-to-Music. Нет нормального: - audio reference - song-to-song - cover/remix существующего трека - extend собственного аудио - replace section/inpaint - reference style через загруженный трек. И непонятки с обучением. А вот с промптами все нарядно - Structured Caption из трех частей: 1. Global Metadata - жанр, subgenre, BPM, key, scale, эмоциональная дуга, production profile. 2. Vocal Details - пол, тембр, манера, backing vocals, harmonies, эффекты. 3. Arrangement - инструменты, развитие по секциям, groove, bass, percussion, spatial FX. И отдельно lyrics с секционными тегами. Ссылки: https://docs.comfy.org/tutorials/audio/minimax/minimax-music-3 https://huggingface.co/MiniMaxAI/MiniMax-Music3 https://huggingface.co/Comfy-Org/MiniMax-Music-3 https://github.com/Comfy-Org/workflow_templates/blob/main/templates/audio_minimax_music_3.json https://github.com/Comfy-Org/ComfyUI/pull/15570 https://www.reddit.com/r/comfyui/comments/1vni9fq/minimax_music_3_is_live_in_comfyui_enjoy_state_of/ @cgevent

Кратко (AI)

Вышла новая open-weight модель MiniMax Music 3, способная генерировать полноценные песни с вокалом. Модель использует гибридную архитектуру на базе Qwen3-8B и Flow Matching, поддерживает работу в ComfyUI и позволяет создавать треки длительностью до 300 секунд.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖