Новость
Black Forest Labs представили мультимодальную модель FLUX 3
Black Forest Labs анонсировали мультимодальную foundation-модель FLUX 3, которая обучается на изображениях, видео, аудио и действиях. Также представлен FLUX-mimic для физических сценариев, уже используемый на производстве Audi.
Black Forest Labs представили FLUX 3 — мультимодальную foundation-модель, обучающуюся на изображениях, видео, аудио и действиях в единой архитектуре. По словам компании, такой подход помогает связывать визуальное восприятие, звук, движение и язык в одной системе. Видео-модуль FLUX 3 поддерживает text-to-video и image-to-video с нативной аудиодорожкой, video-to-video для переноса персонажей и элементов в новую сцену, video-audio continuation, keyframe-to-video, мультиязычные диалоги с синхронизацией по губам, а также agentic chaining для сшивки клипов в многосценные сюжеты. Отдельно отмечены сильная типографика и анимированный дизайн. FLUX 3 Image предназначена для синтеза и редактирования изображений в широком диапазоне стилей, соотношений сторон и разрешений. Black Forest Labs также заявили об улучшенной работе со сложными промптами и многоязычным текстом высокой точности прямо на изображении. Совместно с mimic robotics компания разработала FLUX-mimic — video-action модель на базе FLUX 3, которая уже работает на производстве Audi. Модель доступна в раннем доступе, заявку можно подать на сайте компании.
-
Black Forest Labs представили мультимодальную модель FLUX 3
Neurogen
FLUX 3 Image + Video + Audio + Action Black Forest Labs представили новую мультимодальную foundation-модель, которая обучается одновременно на изображениях, видео, аудио и действиях в единой архитектуре - Изображения фиксируют пространственную структуру в момент времени - Видео добавляют измерение времени и физические законы - Аудио раскрывает причинно-следственные связи между механикой и акустикой - Язык связывает восприятие с целями и инструкциями Обучаясь на всём сразу, модель получает взаимные ограничения: звук должен соответствовать удару, движение - массе, будущее — прошлому 🔘Возможности видео-модуля: - Text-to-video и image-to-video с нативной аудиодорожкой - Video-to-video - перенос персонажей и элементов в новую сцену - Video-audio continuation - генеративное продолжение - Keyframe-to-video для контролируемых переходов - Мультиязычные диалоги с синхронизацией по губам - Огромное стилистическое разнообразие, от camcorder-footage до кинематографа - Agentic chaining - сшивка клипов в многоминутные многосценные сюжеты - Сильная типографика и анимированный дизайн 🔘Video Evaluations FLUX 3 Image Синтез и редактирование в широком диапазоне стилей, соотношений сторон и разрешений. Заявлено значительное улучшение работы со сложными промптами и многоязычным текстом высокой точности прямо на изображении. FLUX 3 Image Samples FLUX-mimic — от генерации к физическому AI Совместно с mimic robotics BFL разработали FLUX-mimic — video-action модель на базе бэкбоуна FLUX 3, уже работающую на производстве Audi Сейчас в раннем доступе все, можно подать заявку на сайте, ждем веса и раскатку, в ближайшие недели по идее https://bfl.ai/models/flux-3