← к ленте

Анонс мультимодальной модели FLUX 3 от Black Forest Labs

М@cgeventAI-инженер
1 мес

Обзор возможностей новой мультимодальной модели FLUX 3 от Black Forest Labs: генерация видео до 20 секунд, работа со звуком и архитектура Self-Flow.

Flux 3 image и Flux 3 Video Спойлер - 20 секунд! Расписываю подробно. Итак, на сайте Чорного Леса воскресла страница про Flux 3. Что мы имеем: FLUX 3 - теперь не просто генератор картинок, а единая мультимодальная модель, которая работает сразу с изображениями, видео, звуком и текстом. Это уже не набор отдельных сетей, а общий движок, который пытается понимать сцену целиком - как выглядят объекты, как они двигаются, взаимодействуют и звучат. На выходе FLUX 3 умеет генерировать и редактировать изображения, а также создавать видео продолжительностью до 20 секунд сразу с родным звуком. Поддерживаются text-to-video, image-to-video, video-to-video, продолжение готового ролика вместе с аудио, переходы между заданными ключевыми кадрами и многоязычные диалоги. Отдельные клипы можно связывать в длинные многосценовые последовательности, сохраняя персонажей через референсы. На вход модель принимает обычный текстовый промпт, изображения-референсы, стартовый кадр, готовое видео, а в режиме продолжения - видео вместе со звуковой дорожкой. То есть можно попросить создать сцену с нуля, оживить картинку, перенести героя из одного ролика в другой или продолжить уже начавшееся действие. С изображениями FLUX 3 работает как редактирующая модель. Звучит сладчайше.. но пока есть только теория. Кстати, за теорию: что такое Self-Flow Это новый способ обучения flow-моделей, при котором генерация и понимание контента развиваются внутри одной архитектуры. Модели намеренно показывают разные части данных с разной степенью зашумления, заставляя ее восстанавливать недостающий смысл самостоятельно. В результате один backbone учится одновременно работать с изображениями, видео, аудио и даже предсказанием действий, без опоры на отдельную внешнюю модель понимания. Когда и доколе? FLUX 3 Video уже запущен в ограниченном Early Access. Ранний доступ к FLUX 3 Image обещают открыть в ближайшие недели. Затем, в течение следующих недель и месяцев(?), BFL планирует выпускать: - генерацию и редактирование видео со звуком через API - приватный доступ к весам - отдельную модель FLUX 3 Image - решения FLUX 3 Action для робототехники - открытую мультимодальную модель FLUX 3 Dev, которую разработчики смогут запускать и дообучать под свои задачи Акцентирую: DEV - это не облегченная версия FLUX 3, а исходная модель, из которой можно делать свои решения. BFL прямо называет ее «open-weight access to a multimodal backbone» Итого: FLUX 3 движется в сторону world models, объединяя генерацию, понимание динамики и предсказание действий - сама BFL использует термин в коммуникациях Real World Model. Точных дат публичного релиза и цен пока нет. На сайте есть форма для Early Access. https://bfl.ai/blog/flux-3 @cgevent

Кратко (AI)

Компания Black Forest Labs анонсировала FLUX 3 — мультимодальную модель, способную работать с текстом, изображениями, видео и звуком. Новая архитектура Self-Flow позволяет модели понимать динамику сцен и предсказывать действия, а видеогенерация поддерживает ролики до 20 секунд с синхронным аудио. В ближайшее время планируется запуск API, открытие весов модели и выпуск специализированных версий для робототехники.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖