Команды «Интерпретируемый ИИ» лаборатории FusionBrain, «Основы генеративного ИИ» Института AIRI и «Генеративная поэзия» Сергея Маркова (SberAI) опубликовали на Хабре итог годичной совместной работы над диффузионными языковыми моделями (dLLMi). Они воспроизводили чужие методы, обучали свои модели и ускоряли инференс, чтобы разобраться, какие подходы к dLLM реально работают, а какие пока не стоят вложенного времени.
В отличие от классических LLM, генерирующих текст токен за токеном слева направо, dLLM раскрывают замаскированные позиции параллельно по всей последовательности — отсюда обещание кратного ускорения генерации. Но на практике эффект ограничен тем, что классический KV-кэшi в диффузионных моделях нормально не работает.
ВыводРазобраны три подхода к dLLM: адаптация готовой LLM в диффузионную, обучение с нуля и дистилляция уже обученной модели