MiniMax H3 Max: 36-кратное ускорение и открытые веса
М@cgeventAI-инженер
10 чАнализ производительности новой модели MiniMax H3 Max, сравнение с H3 и перспективы открытого релиза весов от fal.
Появление сверхбыстрых открытых моделей для генерации видео меняет правила игры для создателей контента.
- Значительное сокращение времени генерации видео делает технологию доступнее для профессионального использования.
- Открытие весов модели позволит сообществу создавать собственные оптимизированные инструменты и плагины.
- Снижение требований к вычислительным мощностям ускорит внедрение нейросетевого видео в повседневные рабочие процессы.
MiniMax H3 Max: 36-кратное ускорение и открытые веса
Огненные новости.
На этих двух роликах - обычный MiniMax H3 (синий галстук) в облаке Minimax Design и новый H3 Max на fal при одинаковых параметрах и на 15 секунд, 720p.
Результат слегка непристойный: обычный H3 генерировал ролик около 6 минут, H3 Max - около 10 секунд. То есть примерно 36x разницы, причем качество как по мне чравнимо. Важно: это не чистый benchmark весов, а сравнение двух разных production-инфраструктур.
Конечно, у fal наверняка огромная дурь для инференсв, но 36x почти наверняка не объясняются одной только дурью.
А щас держите Мега новость:
fal подтвердили, что веса H3 Max будут опубликованы. На вопрос, будет ли открыт и Ref2V, ответил: “yes, working on it”. То есть речь, судя по всему, идет не просто об API, а о полноценном открытом checkpoint H3 Max и в перспективе reference-to-video версии.
И тут интересно покумекать о том, что это будут за веса, код, железо под столом.
Думаю, что ждать, что скачанный H3 Max автоматически окажется локально в 36 раз быстрее H3, не стоит.
fal делали саму модель и inference stack практически одновременно: post-training/RL, вероятно сильно меньшее число sampling steps, оптимизированный attention, fused CUDA/Triton kernels, mixed precision, parallelism, VAE и управление памятью.
Поэтому часть безумной скорости находится в весах, а часть - в инфраструктуре fal. И именно соотношение этих двух частей будет главным вопросом после релиза.
Мой прогноз: просто открытые веса дадут несколько иксов относительно обычного H3, а после появления нормального SGLang/LightX2V/ComfyUI runtime, quantization и оптимизированных kernels разрыв вполне может вырасти до 8-15x.
Ускорение 36x локально - утопия. Имхо.
Грубая пацанская оценка H3 Max для 15 сек / ~768p после community-оптимизаций:
RTX 4090 24 GBquant/offload -десятки секунд\минуты
RTX 5090 32 GB ~30-90 с
H100 80 GB ~10-30 с
H200 141 GB ~7-20 с
B200 192 GB единицы - десятки секунд
После релиза критически важны четыре вещи: число sampling steps, отличие архитектуры от H3, рабочая precision и то, откроет ли fal вместе с весами свои inference kernels/runtime.
https://fal.ai/learn/devs/introducing-h3-max-by-fal
Но новость просто агнищще - Минимаксищще становится сакральным жупелом всей видео генерации.
Я не пощщу по нему апдейты - их примерно 10-20 в день, если брать Лоры, оптимизаторы, кванты, туторы, гайды, вае, шмае, удлинняторы и увеличаторы тайминга и разрешения.
Уже писал, что все это отслеживается тут:
https://github.com/wildminder/awesome-minimax-H3
@cgevent
Кратко (AI)
Модель MiniMax H3 Max демонстрирует 36-кратное ускорение генерации видео по сравнению с оригинальной H3 при использовании инфраструктуры fal. Разработчики подтвердили планы по открытию весов модели, что может значительно ускорить развитие локальных инструментов генерации видео после оптимизации сообществом.
Обсуждение
2по железу с реальными цифрами прогноз - вот что реально ценно, а не сам хайп. скорость размазана между весами и infra, это и есть главный вопрос. если comfyUI/SGLang экосистема быстро подхватит, локальные видео-генерации на 4090 за минуты через месяц будут обычным делом, и баланс open-source vs закрытые API реально начнет шататься.
Разница между весами и инфраструктурой — база, пост это и так расписал. Про 4090 через месяц на comfy/SGLang — это чистый оптимизм, пока не увидим реальные цифры по степам и ядрам от fal.