Обзор диффузионных языковых моделей (dLLM): подходы и результаты
M@mashkka_dsAI-инженер
2 недБольшой разбор диффузионных языковых моделей от команд FusionBrain, AIRI и SberAI: адаптация, обучение с нуля и дистилляция.
Диффузионные модели обещают ускорить генерацию текста, но пока остаются сложной технологией для практического внедрения.
- Диффузионные модели генерируют текст параллельно, а не по одному токену, что потенциально быстрее классических LLM.
- Исследование показывает, что адаптация существующих моделей (например, GigaChat) дает лучшие результаты, чем обучение с нуля.
- Метод дистилляции IDLM позволяет значительно сократить количество шагов генерации, делая модели более пригодными для реальных задач.
⚡️ Диффузионные языковые модели: что в них работает, а что вызывает вопросы
Выложили большой разбор dLLM — результат совместной работы нескольких команд: «Интерпретируемый ИИ» лаборатории FusionBrain, «Основы генеративного ИИ» Института AIRI (@Ivan_Oseledets) и «Генеративная поэзия» Сергея Маркова (@oulenspiegel_channel) SberAI.
tldr: год возились с диффузионными языковыми моделями — воспроизводили чужие методы, обучали свои, ускоряли инференс. Разобрали за вас целое поле и рассказываем, что уже стоит брать, а куда пока лучше не вкладывать время.
Для тех, кто не в теме: dLLM генерируют текст не по одному токену слева направо, а параллельно, раскрывая замаскированные позиции по всей последовательности. Отсюда обещание кратного ускорения — но на практике всё упирается в KV-кэш, который в классической диффузии нормально не работает.
Мы разобрали три подхода — и вот что у нас получилось:
Адаптация — переучить готовую LLM в диффузионную за небольшую долю стоимости исходного претрейна. Сегодня это основной путь к большим dLLM — так получают модели вплоть до сотен миллиардов параметров.
У нас DiffuGPT/DiffuLLaMA не воспроизвёлся: нашли и исправили кучу проблем в коде, прогнали на GPT-2, Qwen и GigaChat — но генерация всё равно осталась плохой. Зато ReFusion + GigaChat 3B завёлся: 2,7× ускорение по wall-clock и более чем 2× рост на GSM8K.
Обучение с нуля — дорого и почти всегда не нужно в прикладном сценарии, но без него сложно проверять методические гипотезы. Разбираем MDLM как полигон для экспериментов и Eso-LM, где ради работающего KV-кэша пожертвовали двунаправленным вниманием.
Дистилляция — ускорить уже обученную модель, сократив число шагов расшумления. Рассказываем про свой метод IDLM (ICML 2026): для MDLM число шагов сокращается с 1024 до 16.
В конце — таблица с рекомендациями: какой подход выбирать под конкретную задачу и ограничения.
👉 Хабр
Кратко (AI)
Команды FusionBrain, AIRI и SberAI опубликовали глубокий анализ диффузионных языковых моделей (dLLM). Исследователи протестировали методы адаптации, обучения с нуля и дистилляции, выявив проблемы существующих подходов и предложив собственный метод IDLM для ускорения инференса.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖