Black Forest Labs анонсировали мультимодальную foundation-модель FLUX 3, которая обучается на изображениях, видео, аудио и действиях. Также представлен FLUX-mimic для физических сценариев, уже используемый на производстве Audi.

Black Forest Labs представили FLUX 3 — мультимодальную foundation-модель, обучающуюся на изображениях, видео, аудио и действиях в единой архитектуре. По словам компании, такой подход помогает связывать визуальное восприятие, звук, движение и язык в одной системе. Видео-модуль FLUX 3 поддерживает text-to-video и image-to-video с нативной аудиодорожкой, video-to-video для переноса персонажей и элементов в новую сцену, video-audio continuation, keyframe-to-video, мультиязычные диалоги с синхронизацией по губам, а также agentic chaining для сшивки клипов в многосценные сюжеты. Отдельно отмечены сильная типографика и анимированный дизайн. FLUX 3 Image предназначена для синтеза и редактирования изображений в широком диапазоне стилей, соотношений сторон и разрешений. Black Forest Labs также заявили об улучшенной работе со сложными промптами и многоязычным текстом высокой точности прямо на изображении. Совместно с mimic robotics компания разработала FLUX-mimic — video-action модель на базе FLUX 3, которая уже работает на производстве Audi. Модель доступна в раннем доступе, заявку можно подать на сайте компании.

Источники 1
  • Black Forest Labs представили мультимодальную модель FLUX 3 Neurogen
    FLUX 3 
    
    Image + Video + Audio + Action
    
    Black Forest Labs представили новую мультимодальную foundation-модель, которая обучается одновременно на изображениях, видео, аудио и действиях в единой архитектуре
    
    - Изображения фиксируют пространственную структуру в момент времени
    - Видео добавляют измерение времени и физические законы
    - Аудио раскрывает причинно-следственные связи между механикой и акустикой
    - Язык связывает восприятие с целями и инструкциями
    
    Обучаясь на всём сразу, модель получает взаимные ограничения: звук должен соответствовать удару, движение - массе, будущее — прошлому
    
    🔘Возможности видео-модуля:
    
    - Text-to-video и image-to-video с нативной аудиодорожкой
    - Video-to-video - перенос персонажей и элементов в новую сцену
    - Video-audio continuation - генеративное продолжение
    - Keyframe-to-video для контролируемых переходов
    - Мультиязычные диалоги с синхронизацией по губам
    - Огромное стилистическое разнообразие, от camcorder-footage до кинематографа
    - Agentic chaining - сшивка клипов в многоминутные многосценные сюжеты
    - Сильная типографика и анимированный дизайн
    
    🔘Video Evaluations
    
    FLUX 3 Image
    
    Синтез и редактирование в широком диапазоне стилей, соотношений сторон и разрешений. Заявлено значительное улучшение работы со сложными промптами и многоязычным текстом высокой точности прямо на изображении.
    
    FLUX 3 Image Samples
    
    FLUX-mimic — от генерации к физическому AI
    
    Совместно с mimic robotics BFL разработали FLUX-mimic — video-action модель на базе бэкбоуна FLUX 3, уже работающую на производстве Audi
    
    Сейчас в раннем доступе все, можно подать заявку на сайте, ждем веса и раскатку, в ближайшие недели по идее
    
    https://bfl.ai/models/flux-3