← к умной ленте

MiniMax H3 Max: fal.ai выпустили ускоренную версию видеомодели H3, обещают открыть веса

Fal.ai показали H3 Max — пост-трейн версию открытой модели MiniMax H3, специально дообученную и оптимизированную под собственный inference-стек fal. Модель генерирует видео быстрее реального времени: 5 секунд ролика за примерно 3 секунды генерации, что fal оценивает как ~35x по throughput относительно официального эндпоинта H3. Модель вышла на первое место в рейтинге Artificial Analysisi среди image-to-video (с аудио) моделей, обогнав Seedance 2.0, оригинальный H3 и старый Gemini Omni Flash.

Главная новость для сообщества — fal подтвердили планы открыть веса H3 Max, а на вопрос про открытие Ref2Vi-версии ответили «yes, working on it». Если это подтвердится, речь идёт о полноценном открытом чекпоинте, а не просто об API.

35x/36xускорение throughput относительно официального H3
$0.04цена за секунду видео первую неделю
768pтекущее максимальное разрешение H3 Max
  • Прямое сравнение на 15 секунд 720p: обычный H3 в облаке MiniMax Design генерировал ролик около 6 минут, H3 Max на fal — около 10 секунд, то есть разница около 36x (сравнение инфраструктур, а не «чистый» бенчмарк весов)
  • fal утверждает, что ускорение достигнуто не за счёт кэширования, агрессивной квантизации или sparse attention — сохраняются нативное аудио и нативное разрешение; использовались RL-пост-трейнинг, меньшее число sampling steps, оптимизированный attention, fused CUDA/Triton kernels, mixed precision, параллелизм, оптимизация VAE и памяти
  • Технические характеристики: 480p и 768p, 24 fps, ролики 5-15 секунд, нативный стерео-звук; при этом обычный H3 на fal поддерживает 2K, а у H3 Max сейчас максимум 768p
  • Цена: первую неделю $0.04 за секунду (скидка 50%), плюс пять бесплатных генераций в день через fal; 5 секунд в 768p стоят сейчас $0.20, после 1 сентября цена вырастет до $0.40
  • Доступны режимы text-to-video и image-to-video; на вопрос о релизе весов fal ответили «We'll release it soon!», а про Ref2V — «yes, working on it»
  • Ранее MiniMax сообщал, что официальный H3 уже CFG-distilledi, а более экстремальные 4/8-NFE версии только исследуются — то есть H3 Max, по всей видимости, отдельная ветка оптимизации fal, а не тот официальный distilled H3
  • Прогноз одного из авторов: локально скачанные веса вряд ли дадут 36x, реалистичнее 8-15x после появления community-раннтаймов (SGLang/LightX2V/ComfyUI) и квантизации; ориентировочное время генерации 15 сек/768p: RTX 4090 24GB — десятки секунд-минуты, RTX 5090 32GB — 30-90 с, H100 80GB — 10-30 с, H200 141GB — 7-20 с, B200 192GB — единицы-десятки секунд
Что дальше

Главный вопрос после релиза — сколько из заявленного ускорения заключено в самих весах H3 Max, а сколько в оптимизированной инфраструктуре fal; ответ станет ясен после публикации весов и появления community-раннтаймов и квантизации.

Это произошло: Подборка инструментов и ресурсов для MiniMax-H3 →

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖