← к ленте

MiniMax Music 3: открытая модель генерации музыки с вокалом

1 нед

MiniMax выпустил открытую модель Music 3 для генерации 5-минутных музыкальных композиций с вокалом, использующую иерархическую архитектуру LLM.

Появление мощных открытых инструментов для генерации музыки делает создание профессионального аудио доступным для широкого круга разработчиков и творцов.

  • Модель позволяет генерировать полноценные 5-минутные треки с вокалом и сложной структурой.
  • Открытый доступ к весам модели позволяет интегрировать её в локальные проекты и сторонние интерфейсы.
  • Оптимизация позволяет запускать генерацию даже на потребительских видеокартах с 8 ГБ памяти.
⚡️ MiniMax Music 3: открытая модель генерации музыки с вокалом MiniMax опубликовал веса модели для создания полноценных композиций длиной до пяти минут, которая понимает музыкальную структуру и выдаёт на выходе 32 kHz стерео в формате 16-bit WAV. Music 3 управляется промптом из текста песни (с тегами вида [Chorus] или [Solo]) и музыкальным описанием (жанр, BPM, тональность, лад и т.д.).
MiniMax советует разбивать промпт на метаданные, детали вокала и аранжировку, но если лень писать руками, можно прогнать запрос через специальный скилл music-caption-rewriter.
🟡Механика Под капотом иерархическая авторегрессионная архитектура из двух уровней. Global LLM отвечает за то, как трек устроен целиком, Local LLM - за то, как он звучит в каждый конкретный момент. 🟢Global LLM: Qwen3-8B, у которой на этапе тренировки сделали дотюн эмбеддингов и выходных слоёв на семантические музыкальные токены. Держит структуру трека и кадр за кадром предсказывает первый RVQ codebook - семантический, на 16 384 записи. 🟢Local LLM (0.6B): внутри каждого кадра достраивает оставшиеся 7 акустических кодбуков и возвращает мелкую акустическую детализацию. Обычно звук декодируют прямо из дискретных RVQ токенов. Здесь вместо этого модуль синтеза сливает финальные скрытые состояния обеих LLM - они непрерывные, и в них остаётся больше информации об артикуляции вокала, текстуре инструментов и непрерывности во времени. Дальше поток идёт по цепочке: слияние скрытых состояний → Flow Matching на 2.4B → латент Flow-VAE → декодер Flow-VAE на 123M → 32 kHz стерео. Дискретный декодер токенизатора на инференсе не нужен вовсе.
Flow-VAE взят из MiniMax Speech и переобучен под динамический диапазон и спектр музыки.
🟡Доступность Модель запускается в SGLangHuggingFace Diffusers и ComfyUI. В полной точности она влезает в 24 GB VRAM, с включённым автоматическим CPU offloading съест около 22 GB. А если подрубить layer-by-layer streaming для языковой модели, то её вполне можно завести даже на карточках с 8 GB видеопамяти, но придётся ждать результата ощутимо дольше. 🟡Ограничения
🟠Streaming generation сейчас вообще не поддерживается, модель отдаёт только готовый кусок. 🟠Входной промпт ограничен длиной в 5 000 токенов. 🟠Аудиовывод упирается в потолок из 9 000 акустических фреймов.
📌Лицензирование: MiniMax-Music3 Community License 🟡Страница проекта 🟡Веса 🟡Демо 🖥GitHub @ai_machinelearning_big_data #AI #ML #TextToMusic #Music3 #MiniMax
MiniMax Music 3: открытая модель генерации музыки с вокалом

Кратко (AI)

Компания MiniMax представила открытую модель Music 3, способную генерировать пятиминутные музыкальные треки с вокалом. Архитектура модели основана на иерархическом подходе с использованием двух LLM и Flow-VAE, что позволяет создавать качественный стереозвук с высокой детализацией.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖