Итоги AMA-сессии разработчиков MiniMax: планы по развитию H3
М@cgeventAI-инженер
3 недРазбор планов MiniMax по развитию модели H3: открытие 2K Regenerate, внедрение Sparse Attention, разработка отдельной image-модели и оптимизация inference.
MiniMax активно развивает свою видеомодель H3, делая её более доступной и быстрой для локального использования.
- Открытие 2K Regenerate позволит пользователям локально улучшать качество генераций.
- Внедрение Sparse Attention значительно ускорит работу модели без потери качества.
- Разработка отдельной image-модели решит проблему использования видеомоделей для создания статичных изображений.
Будущее Минимакса
Красавчики. Пришли на реддит и бахнули огромную АМА сессию. Ответили на тьму вопросов.
https://www.reddit.com/r/StableDiffusion/s/O0rqbtpxzn
Для староверов и ADHD:
Tldr:
2K Regenerate - будет open-source и, судя по формулировке команды, относительно скоро;
Sparse Attention - первая версия тоже “near term”;
официальный 4/8-step рассматривается, но без обещаний по срокам;
отдельная image-модель из линии H3 - в разработке.
Для нормисов :
Самое главное: нативный H3-Regenerate-2K действительно откроют. Это не обычный апскейлер и не «второй прогон тем же H3». Команда пояснила за отдельный latent-space DiT regeneration checkpoint, который генерирует на более высоком разрешении, используя результат базовой модели как дополнительный контекст. Часть референсов также подаётся в повышенном разрешении. Модуль сейчас дорабатывают по скорости и качеству именно для локального использования, поэтому точной даты нет, но на отдельный вопрос «аскороли?» разработа ответили буквально: “yep, not very far”.
По Sparse Attention ещё наряднее. H3 не использует MSA из MiniMax M3, как многие предполагали. Их схема ближе к MoBA-style block selection: соседние visual tokens сильно коррелируют, поэтому MiniMax делает mean-pooling блоков и по этому представлению определяет важные блоки, без отдельного обученного indexer. Сейчас 3D sparsification применяется только к video tokens, потому что именно они съедают большую часть sequence. Image/text tokens пока изучаются как следующие кандидаты.
Кто нихрена не понял - первую открытую реализацию sparse attention обещают в ближайшее время, причём сначала в консервативной конфигурации с целью получить ускорение без заметной потери качества. (Это круто, скорость - главный минус)
С 4/8-step H3 всё чуть менее нарядно. Выпущенный checkpoint уже содержит CFG distillation, плюс на финальной стадии обучения использовалась дополнительная стратегия, благодаря которой модель и сейчас умеет несколько снижать число inference steps. Но это не полноценная step-distilled Turbo-модель. MiniMax продолжает исследовать distillation и прямо рассматривает официальный 4-NFE или 8-NFE вариант, однако честно пишет, что не может пообещать его в ближайшее время. То есть community Turbo LoRA пока останутся актуальны.
Ещё одна неожиданно прельстивая новость - картинки!!
На вопрос про настоящий Text-to-Image / single-frame H3 MiniMax ответил, что они уже делают отдельную image model из общего предка H3 (круто звучит) и рассчитывают выпустить её для сообщества. То есть нынешние хаки «сгенерировать 5 кадров и выдернуть первый» действительно временные - полноценная H3 image-модель официально в разработке.
Из архитектурных деталей команда также поъяснила за prompt adherence. По их словам, дело не в каком-то одном хитром модуле, а в очень широком и разнообразном наборе данных и задач, обученных на общей масштабируемой архитектуре. Иными словами, меньше магических костылей под отдельные задачи, больше общего multimodal training. (Gemini Omni нервничает и готовится апдейтнуться)
@cgevent
Кратко (AI)
Разработчики MiniMax провели AMA-сессию на Reddit, где поделились планами по развитию модели H3. В ближайшее время ожидается открытие исходного кода 2K Regenerate и внедрение Sparse Attention для ускорения работы. Также подтверждена разработка отдельной специализированной модели для генерации изображений.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖