Black Forest Labs обновила страницу FLUX 3 и раскрыла детали новой мультимодальной модели. FLUX 3 объединяет генерацию и редактирование изображений, создание видео до 20 секунд со звуком и работу с текстом; ранний доступ к видео уже открыт, а доступ к изображениям обещают в ближайшие недели.

Black Forest Labs (BFL) раскрыла детали FLUX 3 — новой мультимодальной модели, которая работает с изображениями, видео, звуком и текстом. Компания позиционирует её как шаг к Real World Model: один общий backbone должен понимать сцену целиком, включая объекты, движение, взаимодействия и звук. FLUX 3 умеет генерировать и редактировать изображения, а также создавать видео продолжительностью до 20 секунд с нативным звуком. Поддерживаются text-to-video, image-to-video, video-to-video, продолжение ролика вместе с аудио, переходы между ключевыми кадрами и многоязычные диалоги. Отдельные клипы можно объединять в более длинные многосценовые последовательности с сохранением персонажей через референсы. В качестве ключевой особенности BFL выделяет метод обучения Self-Flow. По словам компании, он позволяет одной архитектуре одновременно развивать генерацию и понимание контента без опоры на отдельную внешнюю модель понимания. FLUX 3 Video уже доступна в ограниченном Early Access. Ранний доступ к FLUX 3 Image компания обещает открыть в ближайшие недели. Также BFL планирует в ближайшие недели и месяцы выпустить генерацию и редактирование видео со звуком через API, приватный доступ к весам, отдельную модель FLUX 3 Image, решения FLUX 3 Action для робототехники и открытую мультимодальную модель FLUX 3 Dev.

Источники 1
  • Black Forest Labs представила FLUX 3 — мультимодальную модель для изображений, видео, звука и текста Метаверсище и ИИще
    Flux 3 image и Flux 3 Video
    
    Спойлер - 20 секунд! 
    
    Расписываю подробно.
    
    Итак, на сайте Чорного Леса воскресла страница про Flux 3. Что мы имеем:
    
    FLUX 3 - теперь не просто генератор картинок, а  единая мультимодальная модель, которая работает сразу с изображениями, видео, звуком и текстом. Это уже не набор отдельных сетей, а общий движок, который пытается понимать сцену целиком - как выглядят объекты, как они двигаются, взаимодействуют и звучат.
    
    На выходе FLUX 3 умеет генерировать и редактировать изображения, а также создавать видео продолжительностью до 20 секунд сразу с родным звуком. Поддерживаются text-to-video, image-to-video, video-to-video, продолжение готового ролика вместе с аудио, переходы между заданными ключевыми кадрами и многоязычные диалоги. Отдельные клипы можно связывать в длинные многосценовые последовательности, сохраняя персонажей через референсы.
    
    На вход модель принимает обычный текстовый промпт, изображения-референсы, стартовый кадр, готовое видео, а в режиме продолжения - видео вместе со звуковой дорожкой. То есть можно попросить создать сцену с нуля, оживить картинку, перенести героя из одного ролика в другой или продолжить уже начавшееся действие.
    
    С изображениями FLUX 3 работает как редактирующая модель.
    
    Звучит сладчайше.. но пока есть только теория.
    
    
    Кстати, за теорию: что такое Self-Flow
    
    Это новый способ обучения flow-моделей, при котором генерация и понимание контента развиваются внутри одной архитектуры. Модели намеренно показывают разные части данных с разной степенью зашумления, заставляя ее восстанавливать недостающий смысл самостоятельно. В результате один backbone учится одновременно работать с изображениями, видео, аудио и даже предсказанием действий, без опоры на отдельную внешнюю модель понимания.
    
    Когда и доколе?
    
    FLUX 3 Video уже запущен в ограниченном Early Access. Ранний доступ к FLUX 3 Image обещают открыть в ближайшие недели. Затем, в течение следующих недель и месяцев(?), BFL планирует выпускать:
    
     - генерацию и редактирование видео со звуком через API
    
    - приватный доступ к весам
    
     - отдельную модель FLUX 3 Image
    
     - решения FLUX 3 Action для робототехники
    
    - открытую мультимодальную модель FLUX 3 Dev, которую разработчики смогут запускать и дообучать под свои задачи
    
    Акцентирую: DEV - это не облегченная версия FLUX 3, а исходная модель, из которой можно делать свои решения. BFL прямо называет ее «open-weight access to a multimodal backbone»
    
    Итого: FLUX 3 движется в сторону world models, объединяя генерацию, понимание динамики и предсказание действий - сама BFL использует термин в коммуникациях Real World Model.
    
    Точных дат публичного релиза и цен пока нет. На сайте есть форма для Early Access.
    
    https://bfl.ai/blog/flux-3
    
    @cgevent