diffuziiaСбросить фильтр ×

Explorative Modeling: новый подход к обучению генеративных моделей

Б@boris_againAI-инженер
1 нед

JoyAI-Video-Edit: 16B-модель для редактирования видео в реальном времени

N@neurohiveAI-инженер
2 нед

AIRI, FusionBrain и SberAI выпустили большой разбор диффузионных языковых моделей (dLLM)

Команды «Интерпретируемый ИИ» лаборатории FusionBrain, «Основы генеративного ИИ» Института AIRI и «Генеративная поэзия» Сергея Маркова (SberAI) опубликовали на Хабре итог годичной совместной работы над диффузионными языковыми моделями (dLLMi). Они воспроизводили чужие методы, обучали свои модели и ускоряли инференс, чтобы разобраться, какие подходы к dLLM реально работают, а какие пока не стоят вложенного времени.

В отличие от классических LLM, генерирующих текст токен за токеном слева направо, dLLM раскрывают замаскированные позиции параллельно по всей последовательности — отсюда обещание кратного ускорения генерации. Но на практике эффект ограничен тем, что классический KV-кэшi в диффузионных моделях нормально не работает.

ВыводРазобраны три подхода к dLLM: адаптация готовой LLM в диффузионную, обучение с нуля и дистилляция уже обученной модели

2,7×ускорение ReFusion+GigaChat 3B по wall-clock
1024 → 16сокращение шагов расшумления методом IDLM
3Bразмер модели GigaChat в эксперименте ReFusion

Полный разбор →

Релиз ComfyUI-Latent-Tiled-PiD для генерации изображений

Н@GreenNeuralRobotsAI-инженер
3 нед
ComfyUI-Latent-Tiled-PiD плаг энд плей декодер для диффузных картинкогенераторов прикрутили в комфи Воркфлоу на гитхабе Спасибо @m_franz #t2i #optimization #qwenimage #flux2 #flux #qi2512 #comfyui #4K
Релиз ComfyUI-Latent-Tiled-PiD для генерации изображений

Выпущен быстрый диффузионный апскейлер LARP-Scaler

L@lovedeathtransformersAI-инженер
1 мес
Вб сгорел, озон в плену, хованский умер, а мы выпустили быстрый диффузионный апскейлер. Скорость как у ганов, но без артефактов ганов. Бьет нвидию и тд по метричкам https://github.com/Vovanm88/LARP-Scaler/

Это всё на сейчас.