← к ленте

Обзор диффузионных языковых моделей (dLLM): подходы и результаты

Н@navuka_i_jiznAI-инженер
2 нед

Большой разбор диффузионных языковых моделей от команд FusionBrain, AIRI и SberAI: адаптация, обучение с нуля и дистилляция.

Диффузионные модели обещают ускорить генерацию текста, но пока остаются сложной технологией для практического внедрения.

  • Диффузионные модели генерируют текст параллельно, а не по одному токену, что потенциально быстрее классических LLM.
  • Исследование показывает, что адаптация существующих моделей (например, GigaChat) дает лучшие результаты, чем обучение с нуля.
  • Метод дистилляции IDLM позволяет значительно сократить количество шагов генерации, делая модели более пригодными для реальных задач.
⚡️ Диффузионные языковые модели: что в них работает, а что вызывает вопросы Выложили большой разбор dLLM — результат совместной работы нескольких команд: «Интерпретируемый ИИ» лаборатории FusionBrain, «Основы генеративного ИИ» Института AIRI (@Ivan_Oseledets) и «Генеративная поэзия» Сергея Маркова (@oulenspiegel_channel) SberAI. tldr: год возились с диффузионными языковыми моделями — воспроизводили чужие методы, обучали свои, ускоряли инференс. Разобрали за вас целое поле и рассказываем, что уже стоит брать, а куда пока лучше не вкладывать время. Для тех, кто не в теме: dLLM генерируют текст не по одному токену слева направо, а параллельно, раскрывая замаскированные позиции по всей последовательности. Отсюда обещание кратного ускорения — но на практике всё упирается в KV-кэш, который в классической диффузии нормально не работает. Мы разобрали три подхода — и вот что у нас получилось: Адаптация — переучить готовую LLM в диффузионную за небольшую долю стоимости исходного претрейна. Сегодня это основной путь к большим dLLM — так получают модели вплоть до сотен миллиардов параметров. У нас DiffuGPT/DiffuLLaMA не воспроизвёлся: нашли и исправили кучу проблем в коде, прогнали на GPT-2, Qwen и GigaChat — но генерация всё равно осталась плохой. Зато ReFusion + GigaChat 3B завёлся: 2,7× ускорение по wall-clock и более чем 2× рост на GSM8K. Обучение с нуля — дорого и почти всегда не нужно в прикладном сценарии, но без него сложно проверять методические гипотезы. Разбираем MDLM как полигон для экспериментов и Eso-LM, где ради работающего KV-кэша пожертвовали двунаправленным вниманием. Дистилляция — ускорить уже обученную модель, сократив число шагов расшумления. Рассказываем про свой метод IDLM (ICML 2026): для MDLM число шагов сокращается с 1024 до 16. В конце — таблица с рекомендациями: какой подход выбирать под конкретную задачу и ограничения. 👉 Хабр

Кратко (AI)

Команды FusionBrain, AIRI и SberAI опубликовали глубокий анализ диффузионных языковых моделей (dLLM). Исследователи протестировали методы адаптации, обучения с нуля и дистилляции, выявив проблемы существующих подходов и предложив собственный метод IDLM для ускорения инференса.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖