Анонс мультимодальной модели FLUX 3 от Black Forest Labs
М@cgeventAI-инженер
1 месОбзор возможностей новой мультимодальной модели FLUX 3 от Black Forest Labs: генерация видео до 20 секунд, работа со звуком и архитектура Self-Flow.
Flux 3 image и Flux 3 Video
Спойлер - 20 секунд!
Расписываю подробно.
Итак, на сайте Чорного Леса воскресла страница про Flux 3. Что мы имеем:
FLUX 3 - теперь не просто генератор картинок, а единая мультимодальная модель, которая работает сразу с изображениями, видео, звуком и текстом. Это уже не набор отдельных сетей, а общий движок, который пытается понимать сцену целиком - как выглядят объекты, как они двигаются, взаимодействуют и звучат.
На выходе FLUX 3 умеет генерировать и редактировать изображения, а также создавать видео продолжительностью до 20 секунд сразу с родным звуком. Поддерживаются text-to-video, image-to-video, video-to-video, продолжение готового ролика вместе с аудио, переходы между заданными ключевыми кадрами и многоязычные диалоги. Отдельные клипы можно связывать в длинные многосценовые последовательности, сохраняя персонажей через референсы.
На вход модель принимает обычный текстовый промпт, изображения-референсы, стартовый кадр, готовое видео, а в режиме продолжения - видео вместе со звуковой дорожкой. То есть можно попросить создать сцену с нуля, оживить картинку, перенести героя из одного ролика в другой или продолжить уже начавшееся действие.
С изображениями FLUX 3 работает как редактирующая модель.
Звучит сладчайше.. но пока есть только теория.
Кстати, за теорию: что такое Self-Flow
Это новый способ обучения flow-моделей, при котором генерация и понимание контента развиваются внутри одной архитектуры. Модели намеренно показывают разные части данных с разной степенью зашумления, заставляя ее восстанавливать недостающий смысл самостоятельно. В результате один backbone учится одновременно работать с изображениями, видео, аудио и даже предсказанием действий, без опоры на отдельную внешнюю модель понимания.
Когда и доколе?
FLUX 3 Video уже запущен в ограниченном Early Access. Ранний доступ к FLUX 3 Image обещают открыть в ближайшие недели. Затем, в течение следующих недель и месяцев(?), BFL планирует выпускать:
- генерацию и редактирование видео со звуком через API
- приватный доступ к весам
- отдельную модель FLUX 3 Image
- решения FLUX 3 Action для робототехники
- открытую мультимодальную модель FLUX 3 Dev, которую разработчики смогут запускать и дообучать под свои задачи
Акцентирую: DEV - это не облегченная версия FLUX 3, а исходная модель, из которой можно делать свои решения. BFL прямо называет ее «open-weight access to a multimodal backbone»
Итого: FLUX 3 движется в сторону world models, объединяя генерацию, понимание динамики и предсказание действий - сама BFL использует термин в коммуникациях Real World Model.
Точных дат публичного релиза и цен пока нет. На сайте есть форма для Early Access.
https://bfl.ai/blog/flux-3
@cgevent
Кратко (AI)
Компания Black Forest Labs анонсировала FLUX 3 — мультимодальную модель, способную работать с текстом, изображениями, видео и звуком. Новая архитектура Self-Flow позволяет модели понимать динамику сцен и предсказывать действия, а видеогенерация поддерживает ролики до 20 секунд с синхронным аудио. В ближайшее время планируется запуск API, открытие весов модели и выпуск специализированных версий для робототехники.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖