Новый подход к генерации изображений от Alibaba
Н@GreenNeuralRobotsAI-инженер
6 днAlibaba представила гибридный метод генерации изображений, сочетающий латентное пространство и работу с пикселями для повышения скорости и качества.
Новый метод обучения нейросетей позволяет создавать более качественные изображения в несколько раз быстрее.
- Устраняет компромисс между скоростью генерации и детализацией изображения.
- Исключает необходимость использования VAE-декодирования, что экономит вычислительные ресурсы.
- Потенциально ускоряет появление более эффективных моделей для генерации графики.
Два подхода к генерации картинок диффузными моделями
Латентный (обычный): картинку сжимают в маленькое скрытое представление через VAE-кодировщик, потом модель шумит и денойзит уже это сжатое представление а в конце VAE возвращает пиксели. Быстро и стабильно но теряет мелкие детали
Пиксельный (напрямую): работает сразу с пикселями без VAE. Качество деталей выше, но напрямую с нуля такую модель обучать очень медленно, сходится сильно хуже латентной
Alibaba нашли компромисс - латентно-пиксельный переход (latent-to-pixel strategy):
1. Претрейн в латентном пространстве - быстро получают хорошие генеративные знания
2. Потом переключаются в пиксельное пространство и дообучают там
Качество на уровне латентных но в 3–5 раз быстрее - не тратится время на VAE-декодирование и нет потери деталей
Не приходится выбирать между скоростью и качеством
Это рисерч, ждем новых моделей от Алибаба
#research #pixelduffusion
VK | MAX
Кратко (AI)
Исследователи из Alibaba предложили гибридный метод обучения диффузионных моделей, который сочетает латентное пространство для предварительного обучения и пиксельное пространство для финальной донастройки. Это позволяет достичь высокого качества деталей без потери скорости, характерной для чисто пиксельных моделей.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖