Команды «Интерпретируемый ИИ» лаборатории FusionBrain, «Основы генеративного ИИ» Института AIRI и «Генеративная поэзия» Сергея Маркова (SberAI) опубликовали на Хабре итог годичной совместной работы над диффузионными языковыми моделями (dLLMi). Они воспроизводили чужие методы, обучали свои модели и ускоряли инференс, чтобы разобраться, какие подходы к dLLM реально работают, а какие пока не стоят вложенного времени.
В отличие от классических LLM, генерирующих текст токен за токеном слева направо, dLLM раскрывают замаскированные позиции параллельно по всей последовательности — отсюда обещание кратного ускорения генерации. Но на практике эффект ограничен тем, что классический KV-кэшi в диффузионных моделях нормально не работает.
2,7×ускорение ReFusion+GigaChat 3B по wall-clock
1024 → 16сокращение шагов расшумления методом IDLM
3Bразмер модели GigaChat в эксперименте ReFusion
- Разобраны три подхода к dLLM: адаптация готовой LLM в диффузионную, обучение с нуля и дистилляцияi уже обученной модели
- Адаптация — основной путь к большим dLLM сегодня, позволяет получать модели вплоть до сотен миллиардов параметров за небольшую долю стоимости исходного претрейна
- Попытка воспроизвести DiffuGPT/DiffuLLaMA не удалась: команда нашла и исправила множество проблем в коде, прогнала эксперименты на GPT-2, Qwen и GigaChat, но генерация всё равно осталась плохой
- Метод ReFusion в связке с GigaChat 3B заработал успешно: получено ускорение 2,7× по wall-clock и более чем 2-кратный рост качества на бенчмарке GSM8K
- Для обучения с нуля разобраны MDLM (как полигон для методических экспериментов) и Eso-LM, где ради работающего KV-кэша разработчики пожертвовали двунаправленным вниманием
- Представлен собственный метод дистилляции IDLM, принятый на ICML 2026: для MDLM он сокращает число шагов расшумления с 1024 до 16
- В публикации есть итоговая таблица с рекомендациями, какой из трёх подходов выбирать под конкретную задачу и ограничения
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖