За последние дни вышло много крутых моделей для работы с видео. Кажется, что от реальности уже не отличить. Gemini Omni Flash от Google вышел на первое место в редактировании видео у Artificial Analysis и собрал почти полный набор: первые места в генерации из текста и из картинки у него уже были. Редактирование там разговорное: даёте инструкцию словами, модель меняет ролик и сохраняет остальную сцену, следующая правка ложится поверх предыдущей. На выходе 720p, 24 кадра в секунду, звук поддерживается сразу, 0,10 $ за секунду видео, правки по той же цене. На части промптов с людьми модель отказ

За последние дни вышло много крутых моделей для работы с видео. Кажется, что от реальности уже не отличить. Gemini Omni Flash от Google вышел на первое место в редактировании видео у Artificial Analysis и собрал почти полный набор: первые места в генерации из текста и из картинки у него уже были. Редактирование там разговорное: даёте инструкцию словами, модель меняет ролик и сохраняет остальную сцену, следующая правка ложится поверх предыдущей. На выходе 720p, 24 кадра в секунду, звук поддерживается сразу, 0,10 $ за секунду видео, правки по той же цене. На части промптов с людьми модель отказывалась генерировать. Через четыре часа его подвинул MiniMax H3, наследник линейки Hailuo. Принимает на вход текст, картинки, видео и звук, выдаёт 5–15 секунд в 24 кадрах с нативным аудио. Первое место в редактировании, второе в генерации из текста, третье из картинки. 2K стоит 0,13 $ за секунду, обещают ещё режим 768p за 0,09 $, попробовать можно в приложении Hailuo AI и через API. Отдельно MiniMax собирается выложить веса под своей лицензией с разрешённой коммерцией для компаний с выручкой до 20 млн $. Если выложат, это будет самая сильная открытая видеомодель с большим отрывом от нынешнего лидера LTX-2.3. А самое любопытное происходит у Seedance 2.5. У неё перестают исчезать предметы, сохраняются те же люди между сценами. И появился монтаж: семь ракурсов за 30 секунд, и во всех те же шесть героинь, раньше склейка означала новое лицо. Ещё обещают нативные 30 секунд в 4K, до 50 референсов на одну генерацию и правку отдельного кадра без развала остального ролика. Собственно, зацените ролик в этом посте, например. @neuro_channel

Источники 1
  • За последние дни вышло много крутых моделей для работы с видео. Кажется, что от реальности уже не отличить. Нейроканал
    За последние дни вышло много крутых моделей для работы с видео. Кажется, что от реальности уже не отличить.
    
    Gemini Omni Flash от Google вышел на первое место в редактировании видео у Artificial Analysis и собрал почти полный набор: первые места в генерации из текста и из картинки у него уже были. Редактирование там разговорное: даёте инструкцию словами, модель меняет ролик и сохраняет остальную сцену, следующая правка ложится поверх предыдущей. На выходе 720p, 24 кадра в секунду, звук поддерживается сразу, 0,10 $ за секунду видео, правки по той же цене. На части промптов с людьми модель отказывалась генерировать.
    
    Через четыре часа его подвинул MiniMax H3, наследник линейки Hailuo. Принимает на вход текст, картинки, видео и звук, выдаёт 5–15 секунд в 24 кадрах с нативным аудио. Первое место в редактировании, второе в генерации из текста, третье из картинки. 2K стоит 0,13 $ за секунду, обещают ещё режим 768p за 0,09 $, попробовать можно в приложении Hailuo AI и через API. Отдельно MiniMax собирается выложить веса под своей лицензией с разрешённой коммерцией для компаний с выручкой до 20 млн $. Если выложат, это будет самая сильная открытая видеомодель с большим отрывом от нынешнего лидера LTX-2.3.
    
    А самое любопытное происходит у Seedance 2.5. У неё перестают исчезать предметы, сохраняются те же люди между сценами. И появился монтаж: семь ракурсов за 30 секунд, и во всех те же шесть героинь, раньше склейка означала новое лицо. Ещё обещают нативные 30 секунд в 4K, до 50 референсов на одну генерацию и правку отдельного кадра без развала остального ролика. 
    
    Собственно, зацените ролик в этом посте, например.
    
    @neuro_channel