Команда разработчиков MiniMax H3 провела большую AMA-сессию на Reddit (r/StableDiffusion), ответив на множество вопросов сообщества о будущем модели генерации видео/изображений H3. Главные анонсы: открытие модуля H3-Regenerate-2Ki для генерации в повышенном разрешении и первая версия sparse attentioni для ускорения инференса — оба «относительно скоро», но без точных дат.
Для пользователей это важно тем, что MiniMax впервые раскрыла техническую архитектуру своих ключевых наработок и подтвердила курс на open-source — то есть локальные пользователи H3 в обозримом будущем получат доступ к инструментам, которые раньше были закрытыми.
- H3-Regenerate-2K — это не апскейлер и не повторный прогон через H3, а отдельный latent-space DiT regeneration checkpoint, который генерирует в более высоком разрешении, используя результат базовой модели как дополнительный контекст (часть референсов также подаётся в повышенном разрешении)
- На вопрос о сроках релиза Regenerate-2K разработчики ответили: «yep, not very far»; модуль сейчас дорабатывают по скорости и качеству для локального использования
- Sparse attention в H3 не использует MSA (как в MiniMax M3), а построена по MoBA-style block selectioni: соседние visual tokens коррелируют, поэтому применяется mean-pooling блоков для определения важных без отдельного обученного indexer
- 3D sparsification сейчас применяется только к video tokens (они занимают большую часть sequence); image/text tokens рассматриваются как следующие кандидаты
- Первую открытую реализацию sparse attention обещают в ближайшее время, сначала в консервативной конфигурации — ради ускорения без заметной потери качества
- Текущий чекпоинт H3 уже содержит CFG distillation плюс дополнительную стратегию из финальной стадии обучения, позволяющую немного снижать число inference steps; официальный режим 4/8-step рассматривается, но без обещаний по срокам
- Команда также подтвердила разработку отдельной image-модели на базе H3 для генерации и редактирования, а также работу над улучшением Ref2VA и снижением размытости деталей
Ожидается открытие исходного кода H3-Regenerate-2K и первой (консервативной) версии sparse attention «в ближайшее время», без точных дат; также готовится отдельная image-модель на базе H3 и улучшения Ref2VA.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖