← к ленте

MiniMax открыла веса видеомодели H3

3 нед

Китайская компания MiniMax опубликовала веса видеомодели H3, способной генерировать ролики со звуком. Доступны базовые модули и инструкции для ComfyUI.

Появление мощной открытой модели для генерации видео расширяет возможности для создания контента.

  • Разработчики получили доступ к весам модели H3 для локального запуска и дообучения.
  • Поддержка русского языка и возможность работы с аудио и видео референсами упрощают создание сложных роликов.
  • Ограничение на коммерческое использование для крупных компаний делает модель доступной в основном для энтузиастов и малого бизнеса.
🌟 MiniMax открыла веса видеомодели H3 Как и было обещано на релизе в пятницу, китайская компания опубликовала модель H3, которая делает короткие ролики со звуком по текстовому описанию, картинкам, видео и аудио на входе. Модель на 33 миллиарда параметров генерирует клипы длиной от 4 до 15 секунд, 24 кадра в секунду, со стереозвуком 32 килогерца, в пропорциях от широких 21:9 до вертикальных 9:16. Реплики персонажей поддерживаются на 11 языках, включая русский. Полный конвейер H3 состоит из трёх частей: 🟠H3-Context-IR разбирает запрос пользователя со всем инпутом (картинки, видео, аудио) и переводит его во внутренний формат, с которым дальше работает модель. 🟢H3-Base по этому формату генерирует видео в разрешении 768p. 🟠H3-Regenerate-2K затем пересобирает сгенерированный ролик в 2K.
Но открыли не всю систему - только модуль, который отвечает непосредственно за генерацию. Закрытыми остались H3-Context-IR и H3-Regenerate-2K.
🟡H3-Base опубликована в 2-х вариантах H3-Base-FL2VA работает с первым и последним кадром. Без картинок на входе это генерация по тексту, с одной или двумя - достройка ролика от заданного кадра или между двумя кадрами. H3-Base-Ref2VA принимает смешанный ввод - до 9 изображений, до 3 видео и до 3 аудиодорожек, но суммарно не больше 12 файлов. Звук без картинки или видео система не примет.
По рейтингу Artificial Analysis, H3 занимает 1 место в редактировании видео, второе в генерации видео по тексту и третье - по изображению.
СomfyUI подготовили детальную инструкцию по использованию в своей среде и опубликовали базовые воркфлоу для генерации по тексту и референсу. Помимо СomfyUI есть кукбуки под SGLangvLLM и diffusers, а так же промпт-гайды под базу и фулл-реф мод.
Лицензия разрешает дообучать модель на своих видео, персонажах или визуальном стиле. Официального кода для трейна пока нет.
⚠️ Коммерческое использование допускается только для компаний с выручкой ниже 20 миллионов долларов. 📌Лицензирование: MiniMax H3 Community License 🟡Модель 🟡Сообщество в Discord @ai_machinelearning_big_data #AI #ML #Video #H3 #Minimax
MiniMax открыла веса видеомодели H3

Кратко (AI)

Китайская компания MiniMax открыла веса своей видеомодели H3, которая генерирует видео со звуком по текстовым и мультимедийным запросам. Опубликованы только базовые модули генерации, в то время как вспомогательные компоненты для обработки контекста и апскейлинга остались закрытыми. Модель доступна для использования в ComfyUI с ограничениями на коммерческое использование для компаний с выручкой более 20 миллионов долларов.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖