Black Forest Labs ненадолго опубликовала страницу FLUX 3 с описанием единой мультимодальной модели для изображений, видео, звука и действий. Страница была быстро удалена, но на фоне тизера и сообщений разработчиков в сообществе обсуждают, что компания может готовить world model.

Black Forest Labs ненадолго показала страницу /models/flux-3 с описанием единой мультимодальной модели, которая может генерировать изображения, видео, звук и «действия», а также обладать пониманием мира. Страницу быстро удалили, но копия сохранилась в Wayback Machine. Параллельно глава BFL Робин Ромбах опубликовал загадочный видеотизер, а разработчик Machine Delusions написал, что уже работает с «новой моделью» и что публика к ней не готова. На Reddit это связали с возможным переходом компании от генерации изображений к полноценной world model. В обсуждении также вспоминают техническую базу BFL: весной компания представила Self-Flow — архитектуру для совместного обучения на изображениях, видео и аудио с прицелом на планирование и робототехнику.

Источники 1
  • Black Forest Labs тизерит FLUX 3 как мультимодальную world model Метаверсище и ИИще
    FLUX 3 засветили раньше времени - и это похоже, не просто генератор картинок
    
    За последние сутки вокруг FLUX 3 разгорелся прям хайпхайп. 
    На сайте Black Forest Labs ненадолго появилась страница /models/flux-3 с обещанием единой мультимодальной модели, которая генерирует изображения, видео, звук и даже «действия»(?!), а заодно обладает пониманием мира.
    
     Страницу быстро удалили, но интернет, но копия осталась в Wayback Machine. 
    
    Почти одновременно глава BFL Робин Ромбах опубликовал загадочный видеотизер, а разработчик Machine Delusions заявил, что уже играет с «новой моделью» и что публика к ней не готова.
    
    FLUX 3, похоже, метит не в очередной красивый text-to-image, а в полноценную world model: техническая почва у BFL уже есть - весной компания показала Self-Flow, архитектуру для совместного обучения на изображениях, видео и аудио с заделом на планирование и робототехнику. 
    
    На Reddit энтузиазм быстро сменился традиционным нытьем: будут ли открытые веса, сколько сотен гигабайт займёт модель и не окажется ли вся магия доступна только через API.
    
    Я думаю, что Black Forest Labs готовится переобуться из генерации картинок в генерацию  миров. И наверное они как обычно сделают открытую дев-версию для бедных и про-версию для олигархов по АПИ. 
    
    https://www.reddit.com/r/StableDiffusion/s/yudqqGFVGf
    
    https://x.com/Machinedelusion/status/2079985822535749884
    
    @cgevent