Мускриптор: Audio To MIDI
Kyutai(да, те самые, с реалтаймовым голосом) вместе с MireloAI выпустили MuScriptor -
открытую модель, которая превращает готовую песню в набор отдельных MIDI-партий. Она умеет «услышать» барабаны, бас, клавиши, вокал и другие инструменты прямо из финального микса, Без Исходных Дорожек.
Еще раз - в отдельные MIDI-дорожки для разных инструментов. Причем ей не нужны исходные мультитреки - она работает прямо с финальным сведенным миксом.
Демо:
https://muscriptor.kyutai.org/
Код:
https://github.com/muscriptor/muscriptor
Папира:
https://arxiv.org/abs/2607.08168
А теперь представим: берем трек из Суны, разбиваем на МИДИ, суваем в Суну. Аранжировщики, чо.
Для Гиков:
MuScriptor обучали в три этапа. Главная проблема музыкальной транскрипции в том, что почти не существует больших наборов данных, где готовая песня идеально размечена по нотам и инструментам. Поэтому сначала исследователи использовали около **1,45 млн MIDI-файлов**, в которых вся эта информация уже содержится.
Из каждого MIDI во время обучения автоматически создавались десятки вариантов звучания: менялись инструменты, темп, тональность и громкость, после чего композиция **озвучивалась с помощью более 250 различных виртуальных наборов инструментов**. Благодаря этому одна и та же мелодия каждый раз звучала по-новому, а модель училась распознавать музыку в самых разных вариантах исполнения.
Но синтетическая музыка слишком отличается от реальных записей. Поэтому второй этап — дообучение на **170 тысячах настоящих треков** (более 11 тысяч часов аудио). Перед этим MIDI автоматически синхронизировали с живым исполнением, чтобы ноты максимально точно совпадали с записью.
В основе MuScriptor лежит Transformer, который получает спектрограмму аудио и генерирует последовательность MIDI-событий: определяет, какие ноты звучат, когда они начинаются и заканчиваются, а также каким инструментам принадлежат. Модель также может учитывать заранее известный список инструментов в композиции, что заметно снижает количество ошибок.
Финальная настройка выполнялась с помощью **reinforcement learning** на 300 тщательно проверенных композициях. Вместо оценки отдельных нот модель училась максимизировать качество всей транскрипции целиком. Именно сочетание масштабного обучения на синтетической музыке, большого объема реальных записей и RL позволило MuScriptor добиться высокой точности на сложных коммерческих треках.
@cgevent