Новость
MiniMax представила открытую мультимодальную модель H3 для генерации текста, изображений, видео и аудио
MiniMax выпустила опенсорсную мультимодальную модель H3, которая объединяет генерацию текста, изображений, видео и аудио. Модель умеет создавать ролики до 15 секунд в нативном разрешении 2K со стереозвуком и, по заявлению компании, будет доступна в виде весов в ближайшие дни.
Компания MiniMax представила опенсорсную мультимодальную модель H3 для генерации текста, изображений, видео и аудио в единой системе. Модель способна создавать видеоролики длиной до 15 секунд в нативном разрешении 2K и сразу генерировать стереозвук, включая голоса, эффекты и музыку, без дополнительных инструментов. H3 умеет работать с несколькими типами входных данных одновременно: в промпт можно загрузить видео, изображение и аудио, а затем задать нужное преобразование. Среди заявленных возможностей — понимание сложных инструкций, рендеринг текста и брендов, а также перенос движений между видео. MiniMax сообщает, что генерация в 2K обходится более чем в три раза дешевле, чем у основных конкурентов. Компания также заявила, что в ближайшие дни опубликует веса модели в открытом доступе.
-
MiniMax представила открытую мультимодальную модель H3 для генерации текста, изображений, видео и аудио
Neurogen
MiniMax H3 Опен сорс мультимодалка для генерации текста, изображений, видео и аудио в единой бесшовной системе 🔘Видео в 2K со стереозвуком, Модель генерирует ролики длиной до 15 секунд в нативном разрешении 2K, она сразу создает качественный стереозвук (голоса, эффекты и музыку) без костылей 🔘Гениальное понимание контекста, вы можете закинуть в промпт видео, картинку и аудио одновременно, просто написав: «Возьми движение камеры из Видео 1, заставь персонажа из Картинки 2 петь, используя вокал из Аудио 3» H3 сама всё поймет и сведет Генерация в 2K обходится более чем в 3 раза дешевле, чем у главных конкурентов на рынке MiniMax планирует в ближайшие дни выложить веса модели в открытый доступ Разработчики полностью переработали архитектуру: технологии H3-VAE и In-Context Regeneration позволяют модели отлично понимать инструкции, идеально рендерить текст, бренды и переносить движения (V2V) https://www.minimax.io/blog/minimax-h3 Обратный отсчет выхода в опенсорс