MiniMax опубликовала веса модели H3, которая генерирует видео со звуком по тексту, изображениям, видео и аудио. Открыт только модуль H3-Base, остальные части конвейера остаются закрытыми.

Китайская компания MiniMax опубликовала веса модели H3 для генерации видео со звуком на основе текстовых описаний, изображений, видео и аудио. Модель насчитывает 33 млрд параметров и создает клипы длительностью от 4 до 15 секунд с частотой 24 кадра/с и стереозвуком 32 кГц. Полный конвейер H3 включает три компонента: H3-Context-IR для анализа ввода, H3-Base для генерации в 768p и H3-Regenerate-2K для повышения до 2K. При этом открыт только H3-Base; остальные модули остаются закрытыми. H3-Base доступен в двух вариантах: H3-Base-FL2VA для работы по первому и последнему кадру и H3-Base-Ref2VA для смешанного ввода до 9 изображений, 3 видео и 3 аудио. Модель распространяется по лицензии MiniMax H3 Community License, которая разрешает дообучение, но ограничивает коммерческое использование компаниями с выручкой менее $20 млн.

Источники 1
  • MiniMax открыла веса модели H3 для генерации видео со звуком Machinelearning
    🌟 MiniMax открыла веса видеомодели H3
    
    Как и было обещано на релизе в пятницу, китайская компания опубликовала модель H3, которая делает короткие ролики со звуком по текстовому описанию, картинкам, видео и аудио на входе.
    
    Модель на 33 миллиарда параметров генерирует клипы длиной от 4 до 15 секунд, 24 кадра в секунду, со стереозвуком 32 килогерца, в пропорциях от широких 21:9 до вертикальных 9:16. Реплики персонажей поддерживаются на 11 языках, включая русский.
    
    Полный конвейер H3 состоит из трёх частей:
    
    🟠H3-Context-IR разбирает запрос пользователя со всем инпутом (картинки, видео, аудио) и переводит его во внутренний формат, с которым дальше работает модель.
    
    🟢H3-Base по этому формату генерирует видео в разрешении 768p.
    
    🟠H3-Regenerate-2K затем пересобирает сгенерированный ролик в 2K.
    
    Но открыли не всю систему - только модуль, который отвечает непосредственно за генерацию. Закрытыми остались H3-Context-IR и H3-Regenerate-2K.
    
    🟡H3-Base опубликована в 2-х вариантах
    
    H3-Base-FL2VA работает с первым и последним кадром. Без картинок на входе это генерация по тексту, с одной или двумя - достройка ролика от заданного кадра или между двумя кадрами.
    
    H3-Base-Ref2VA принимает смешанный ввод - до 9 изображений, до 3 видео и до 3 аудиодорожек, но суммарно не больше 12 файлов. Звук без картинки или видео система не примет.
    
    По рейтингу Artificial Analysis, H3 занимает 1 место в редактировании видео, второе в генерации видео по тексту и третье - по изображению.
    
    СomfyUI подготовили детальную инструкцию по использованию в своей среде и опубликовали базовые воркфлоу для генерации по тексту и референсу.
    
    Помимо СomfyUI есть кукбуки под SGLang, vLLM и diffusers, а так же промпт-гайды под базу и фулл-реф мод.
    
    Лицензия разрешает дообучать модель на своих видео, персонажах или визуальном стиле. Официального кода для трейна пока нет.
    
    ⚠️ Коммерческое использование допускается только для компаний с выручкой ниже 20 миллионов долларов.
    
    
    📌Лицензирование: MiniMax H3 Community License
    
    
    🟡Модель
    
    
    @ai_machinelearning_big_data
    
    #AI #ML #Video #H3 #Minimax