← к умной ленте

MiniMax выпустила видеогенератор H3 с открытыми весами

AI-редакция
13 источников · показать все· свернуть
хайп · 13обновлено 2 нед назад

Шанхайский стартап MiniMax представил новое поколение видеогенератора Hailuo — H3, объединяющее в одной модели генерацию видео и звука, редактирование и режиссуру сцен. Модель официально запущена 31 июля 2026 года, а в течение недели компания действительно опубликовала веса на Hugging Face, чем удивила рынок: до этого лидерами открытого видео были в основном LTX и Wan.

H3 генерирует ролики длиной от 4-5 до 15 секунд в 2K с нативным стереозвуком, поддерживает мультимодальные референсы (изображения, видео, аудио), перенос движения и редактирование готового видео текстовыми командами. По заявлениям MiniMax, себестоимость генерации втрое ниже конкурентов от ByteDance (Seedance) и Kuaishou, а по рейтингу Artificial Analysis модель заняла 1-е место в редактировании видео, 2-е — в text-to-video и 3-е — в image-to-video.

33 млрдпараметров модели H3
до 15 секунддлительность генерируемого видео
$20 млнпорог выручки для коммерческой лицензии
  • До официального релиза H3 несколько дней раздавали ранним партнёрам, при этом на сайте MiniMax формально ещё висела Hailuo 2.3 как актуальная публичная модель
  • Reuters со ссылкой на MiniMax сообщил, что веса опубликуют «в течение нескольких дней после запуска 31 июля 2026»; лицензия называется MiniMax H3 Community License и разрешает дообучение, но коммерческое использование — только компаниям с выручкой ниже $20 млн
  • Модель весит 33 млрд параметров, выдаёт 24 fps, стерео 32 кГц, соотношения от 21:9 до 9:16, реплики персонажей на 11 языках включая русский
  • Полный пайплайн из трёх модулей: H3-Context-IR (разбор запроса), H3-Base (генерация в 768p), H3-Regenerate-2K (доводка до 2K) — открыт только H3-Base, остальные два модуля закрытые
  • H3-Base выпущен в двух вариантах: FL2VA (работа по первому/последнему кадру, text-to-video/image-to-video) и Ref2VA (до 9 изображений, 3 видео и 3 аудио, суммарно не более 12 файлов референсов)
  • На вход можно подавать текст, до девяти изображений, трёх видеореференсов и трёх аудиофайлов; полный BF16-трансформер весит 66 ГБ, появились облегчённые pruned-версии (40 ГБ) и GGUF-квантыi от Q3 до Q5 (15,6–23,9 ГБ)
  • Community-энтузиасты за неделю выпустили day-0 поддержку в ComfyUIi, воркфлоу под SGLang/vLLM/diffusers, custom-пак ComfyUI MiniMax H3 Director, оптимизацию Sol-Attn и даже расцензуренные VAE-версии на Hugging Face/Civitai, что вызвало страйки от сотрудника MiniMax
Что дальше

Пока открыт только базовый генеративный модуль H3-Base — модули контекстной обработки и доводки до 2K остаются закрытыми, официального кода для обучения нет. Сообщество продолжает наращивать инфраструктуру (кванты, воркфлоу, оптимизации), сравнивая перспективы H3 с экосистемой LTX и ожидаемым ответом от Flux.

Здесь появится ссылка, когда это произойдёт.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖