Сбер опубликовал в открытом доступе алгоритм KVAE-Audio, предназначенный для эффективного сжатия аудиоданных с коэффициентом 960x. Разработка оптимизирует процесс обучения диффузионных моделей и обеспечивает более высокое качество генерации звука по сравнению с аналогичными решениями от Sony, Meta и Stability AI. Новый токенизатор решает проблему компактности данных, что позволяет повысить эффективность работы генеративных нейросетей.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖