← к ленте

Kyutai и MireloAI представили MuScriptor: модель для конвертации аудио в MIDI

М@cgeventAI-инженер
1 мес

Kyutai и MireloAI выпустили MuScriptor — открытую модель, которая преобразует финальный аудиомикс в отдельные MIDI-партии инструментов без исходных дорожек.

Мускриптор: Audio To MIDI Kyutai(да, те самые, с реалтаймовым голосом) вместе с MireloAI выпустили MuScriptor - открытую модель, которая превращает готовую песню в набор отдельных MIDI-партий. Она умеет «услышать» барабаны, бас, клавиши, вокал и другие инструменты прямо из финального микса, Без Исходных Дорожек. Еще раз - в отдельные MIDI-дорожки для разных инструментов. Причем ей не нужны исходные мультитреки - она работает прямо с финальным сведенным миксом. Демо: https://muscriptor.kyutai.org/ Код: https://github.com/muscriptor/muscriptor Папира: https://arxiv.org/abs/2607.08168 А теперь представим: берем трек из Суны, разбиваем на МИДИ, суваем в Суну. Аранжировщики, чо. Для Гиков:
MuScriptor обучали в три этапа. Главная проблема музыкальной транскрипции в том, что почти не существует больших наборов данных, где готовая песня идеально размечена по нотам и инструментам. Поэтому сначала исследователи использовали около **1,45 млн MIDI-файлов**, в которых вся эта информация уже содержится. Из каждого MIDI во время обучения автоматически создавались десятки вариантов звучания: менялись инструменты, темп, тональность и громкость, после чего композиция **озвучивалась с помощью более 250 различных виртуальных наборов инструментов**. Благодаря этому одна и та же мелодия каждый раз звучала по-новому, а модель училась распознавать музыку в самых разных вариантах исполнения. Но синтетическая музыка слишком отличается от реальных записей. Поэтому второй этап — дообучение на **170 тысячах настоящих треков** (более 11 тысяч часов аудио). Перед этим MIDI автоматически синхронизировали с живым исполнением, чтобы ноты максимально точно совпадали с записью. В основе MuScriptor лежит Transformer, который получает спектрограмму аудио и генерирует последовательность MIDI-событий: определяет, какие ноты звучат, когда они начинаются и заканчиваются, а также каким инструментам принадлежат. Модель также может учитывать заранее известный список инструментов в композиции, что заметно снижает количество ошибок. Финальная настройка выполнялась с помощью **reinforcement learning** на 300 тщательно проверенных композициях. Вместо оценки отдельных нот модель училась максимизировать качество всей транскрипции целиком. Именно сочетание масштабного обучения на синтетической музыке, большого объема реальных записей и RL позволило MuScriptor добиться высокой точности на сложных коммерческих треках.
@cgevent

Кратко (AI)

Компании Kyutai и MireloAI представили открытую модель MuScriptor, способную извлекать MIDI-партии отдельных инструментов из готового аудиомикса. Модель обучалась в три этапа, включая использование синтетических данных, реальных записей и обучение с подкреплением, что позволяет ей работать без исходных мультитреков.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖