Black Forest Labs готовит мультимодальную модель FLUX 3
М@cgeventAI-инженер
1 месНа сайте Black Forest Labs появилась страница модели FLUX 3, обещающей генерацию видео, звука и «действий» в рамках концепции world model.
FLUX 3 засветили раньше времени - и это похоже, не просто генератор картинок
За последние сутки вокруг FLUX 3 разгорелся прям хайпхайп.
На сайте Black Forest Labs ненадолго появилась страница /models/flux-3 с обещанием единой мультимодальной модели, которая генерирует изображения, видео, звук и даже «действия»(?!), а заодно обладает пониманием мира.
Страницу быстро удалили, но интернет, но копия осталась в Wayback Machine.
Почти одновременно глава BFL Робин Ромбах опубликовал загадочный видеотизер, а разработчик Machine Delusions заявил, что уже играет с «новой моделью» и что публика к ней не готова.
FLUX 3, похоже, метит не в очередной красивый text-to-image, а в полноценную world model: техническая почва у BFL уже есть - весной компания показала Self-Flow, архитектуру для совместного обучения на изображениях, видео и аудио с заделом на планирование и робототехнику.
На Reddit энтузиазм быстро сменился традиционным нытьем: будут ли открытые веса, сколько сотен гигабайт займёт модель и не окажется ли вся магия доступна только через API.
Я думаю, что Black Forest Labs готовится переобуться из генерации картинок в генерацию миров. И наверное они как обычно сделают открытую дев-версию для бедных и про-версию для олигархов по АПИ.
https://www.reddit.com/r/StableDiffusion/s/yudqqGFVGf
https://x.com/Machinedelusion/status/2079985822535749884
@cgevent
Кратко (AI)
На сайте Black Forest Labs была замечена страница модели FLUX 3, которая позиционируется как мультимодальная система с поддержкой генерации изображений, видео, звука и действий. Эксперты предполагают, что компания переходит от простых генераторов изображений к созданию полноценной world model, опираясь на свои предыдущие наработки в архитектуре Self-Flow.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖