Компания Black Forest Labs (BFL) анонсировала FLUX 3 — не просто новый генератор картинок, а единую мультимодальную модель, которая работает с изображениями, видео, звуком и текстом в рамках одного «движка», понимающего сцену целиком: как выглядят объекты, как они двигаются и звучат. Модель умеет создавать и редактировать изображения, а также генерировать видео длиной до 20 секунд сразу с нативным звуком, поддерживает text-to-video, image-to-video, video-to-video, продолжение роликов, переходы между ключевыми кадрами и многоязычные диалоги.
Анонс получился смазанным: страница /models/flux-3 ненадолго появилась на сайте BFL и была удалена, но осталась в Wayback Machine. Затем глава BFL Робин Ромбах опубликовал загадочный тизер, а разработчик Machine Delusions заявил, что уже тестирует модель и «публика к ней не готова». Официально FLUX 3 Video запущен в ограниченном Early Accessi, доступ к FLUX 3 Image обещают открыть в ближайшие недели; открытые веса FLUX 3 Devi пока только запланированы.
- Техническая основа модели — архитектура Self-Flowi, показанная BFL весной: способ совместного обучения на изображениях, видео и аудио с заделом на предсказание действий и планирование для робототехники, без опоры на отдельную модель понимания.
- Модель принимает на вход текстовый промпт, референсные изображения, стартовый кадр, готовое видео, а в режиме продолжения — видео вместе со звуковой дорожкой; отдельные клипы можно связывать в многосценовые последовательности, сохраняя персонажей через референсы.
- По тестам канала Derp Learning: цензура в FLUX 3 заметно слабее, чем у Seedance2 (который блокировал слово gun); работает промт-фильтр — в политических запросах появляются сгенерированные вотермарки, звук может пропадать или расходиться по синхронизации.
- В первый день тестирования генерация была доступна только в 480p, на второй день открыли 720p.
- Егор Апполонов (Нейронутые) получил доступ и провёл серию тестов, включая генерацию с русскоязычными промптами и реконструкцию финальной сцены «Грязных танцев»; открытые вопросы — качество в 1080p, консистентность персонажей на хронометраже 1–15 минут, объём принимаемых референсов и удержание голосов героев.
- Канал Метаверсище и ИИще (@cgevent) провёл «драки-бенчмарк» с промптом про кунг-фу в тесных помещениях: модель показала неплохое понимание промпта, но озвучка «вялая» и генерация медленнее, чем у Seedance.
- vc.ru подтвердил факт анонса: модель для генерации изображений, видео и аудио, в открытый доступ пока не выпущена.
Ожидается постепенный релиз в течение ближайших недель и месяцев: открытие Early Access к FLUX 3 Image, а затем — публикация открытых весов FLUX 3 Dev. Ключевые вопросы, на которые ответит полноценный релиз: качество в 1080p, управляемость и консистентность на длинных роликах, объём поддерживаемых референсов и удержание голосов персонажей.
Это произошло: Grok Imagine получил функции сохранения лица и голоса →
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖