Новость
Black Forest Labs представила FLUX 3 — мультимодальную модель для изображений, видео, звука и текста
Black Forest Labs обновила страницу FLUX 3 и раскрыла детали новой мультимодальной модели. FLUX 3 объединяет генерацию и редактирование изображений, создание видео до 20 секунд со звуком и работу с текстом; ранний доступ к видео уже открыт, а доступ к изображениям обещают в ближайшие недели.
Black Forest Labs (BFL) раскрыла детали FLUX 3 — новой мультимодальной модели, которая работает с изображениями, видео, звуком и текстом. Компания позиционирует её как шаг к Real World Model: один общий backbone должен понимать сцену целиком, включая объекты, движение, взаимодействия и звук. FLUX 3 умеет генерировать и редактировать изображения, а также создавать видео продолжительностью до 20 секунд с нативным звуком. Поддерживаются text-to-video, image-to-video, video-to-video, продолжение ролика вместе с аудио, переходы между ключевыми кадрами и многоязычные диалоги. Отдельные клипы можно объединять в более длинные многосценовые последовательности с сохранением персонажей через референсы. В качестве ключевой особенности BFL выделяет метод обучения Self-Flow. По словам компании, он позволяет одной архитектуре одновременно развивать генерацию и понимание контента без опоры на отдельную внешнюю модель понимания. FLUX 3 Video уже доступна в ограниченном Early Access. Ранний доступ к FLUX 3 Image компания обещает открыть в ближайшие недели. Также BFL планирует в ближайшие недели и месяцы выпустить генерацию и редактирование видео со звуком через API, приватный доступ к весам, отдельную модель FLUX 3 Image, решения FLUX 3 Action для робототехники и открытую мультимодальную модель FLUX 3 Dev.
-
Black Forest Labs представила FLUX 3 — мультимодальную модель для изображений, видео, звука и текста
Метаверсище и ИИще
Flux 3 image и Flux 3 Video Спойлер - 20 секунд! Расписываю подробно. Итак, на сайте Чорного Леса воскресла страница про Flux 3. Что мы имеем: FLUX 3 - теперь не просто генератор картинок, а единая мультимодальная модель, которая работает сразу с изображениями, видео, звуком и текстом. Это уже не набор отдельных сетей, а общий движок, который пытается понимать сцену целиком - как выглядят объекты, как они двигаются, взаимодействуют и звучат. На выходе FLUX 3 умеет генерировать и редактировать изображения, а также создавать видео продолжительностью до 20 секунд сразу с родным звуком. Поддерживаются text-to-video, image-to-video, video-to-video, продолжение готового ролика вместе с аудио, переходы между заданными ключевыми кадрами и многоязычные диалоги. Отдельные клипы можно связывать в длинные многосценовые последовательности, сохраняя персонажей через референсы. На вход модель принимает обычный текстовый промпт, изображения-референсы, стартовый кадр, готовое видео, а в режиме продолжения - видео вместе со звуковой дорожкой. То есть можно попросить создать сцену с нуля, оживить картинку, перенести героя из одного ролика в другой или продолжить уже начавшееся действие. С изображениями FLUX 3 работает как редактирующая модель. Звучит сладчайше.. но пока есть только теория. Кстати, за теорию: что такое Self-Flow Это новый способ обучения flow-моделей, при котором генерация и понимание контента развиваются внутри одной архитектуры. Модели намеренно показывают разные части данных с разной степенью зашумления, заставляя ее восстанавливать недостающий смысл самостоятельно. В результате один backbone учится одновременно работать с изображениями, видео, аудио и даже предсказанием действий, без опоры на отдельную внешнюю модель понимания. Когда и доколе? FLUX 3 Video уже запущен в ограниченном Early Access. Ранний доступ к FLUX 3 Image обещают открыть в ближайшие недели. Затем, в течение следующих недель и месяцев(?), BFL планирует выпускать: - генерацию и редактирование видео со звуком через API - приватный доступ к весам - отдельную модель FLUX 3 Image - решения FLUX 3 Action для робототехники - открытую мультимодальную модель FLUX 3 Dev, которую разработчики смогут запускать и дообучать под свои задачи Акцентирую: DEV - это не облегченная версия FLUX 3, а исходная модель, из которой можно делать свои решения. BFL прямо называет ее «open-weight access to a multimodal backbone» Итого: FLUX 3 движется в сторону world models, объединяя генерацию, понимание динамики и предсказание действий - сама BFL использует термин в коммуникациях Real World Model. Точных дат публичного релиза и цен пока нет. На сайте есть форма для Early Access. https://bfl.ai/blog/flux-3 @cgevent