← к умной ленте

MiniMax H3: команда провела AMA на Reddit и рассказала о планах развития модели

Команда разработчиков MiniMax H3 провела большую AMA-сессию на Reddit (r/StableDiffusion), ответив на множество вопросов сообщества о будущем модели генерации видео/изображений H3. Главные анонсы: открытие модуля H3-Regenerate-2Ki для генерации в повышенном разрешении и первая версия sparse attentioni для ускорения инференса — оба «относительно скоро», но без точных дат.

Для пользователей это важно тем, что MiniMax впервые раскрыла техническую архитектуру своих ключевых наработок и подтвердила курс на open-source — то есть локальные пользователи H3 в обозримом будущем получат доступ к инструментам, которые раньше были закрытыми.

2Kразрешение модуля Regenerate
4/8-stepрассматриваемый быстрый режим инференса
  • H3-Regenerate-2K — это не апскейлер и не повторный прогон через H3, а отдельный latent-space DiT regeneration checkpoint, который генерирует в более высоком разрешении, используя результат базовой модели как дополнительный контекст (часть референсов также подаётся в повышенном разрешении)
  • На вопрос о сроках релиза Regenerate-2K разработчики ответили: «yep, not very far»; модуль сейчас дорабатывают по скорости и качеству для локального использования
  • Sparse attention в H3 не использует MSA (как в MiniMax M3), а построена по MoBA-style block selectioni: соседние visual tokens коррелируют, поэтому применяется mean-pooling блоков для определения важных без отдельного обученного indexer
  • 3D sparsification сейчас применяется только к video tokens (они занимают большую часть sequence); image/text tokens рассматриваются как следующие кандидаты
  • Первую открытую реализацию sparse attention обещают в ближайшее время, сначала в консервативной конфигурации — ради ускорения без заметной потери качества
  • Текущий чекпоинт H3 уже содержит CFG distillation плюс дополнительную стратегию из финальной стадии обучения, позволяющую немного снижать число inference steps; официальный режим 4/8-step рассматривается, но без обещаний по срокам
  • Команда также подтвердила разработку отдельной image-модели на базе H3 для генерации и редактирования, а также работу над улучшением Ref2VA и снижением размытости деталей
Что дальше

Ожидается открытие исходного кода H3-Regenerate-2K и первой (консервативной) версии sparse attention «в ближайшее время», без точных дат; также готовится отдельная image-модель на базе H3 и улучшения Ref2VA.

Здесь появится ссылка, когда это произойдёт.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖