Исследователи из NVIDIA, Принстона и MIT представили MOTIVE — градиентный фреймворк для атрибуции данных, ориентированный на движение. По их данным, он позволяет обучать модель на 10% видео и получать качество на уровне или лучше, чем при использовании полного датасета.

Исследователи из NVIDIA, Принстона и MIT представили MOTIVE (MOTIon attribution for Video gEneration) — градиентный фреймворк для атрибуции данных, ориентированный на движение. Метод предназначен для современных моделей видеодиффузии и flow-matching и помогает отделять временную динамику от статического внешнего вида за счёт вычисления градиентов через взвешенные по движению маски потерь. Авторы отмечают, что для масштабирования на крупные архитектуры используются структурированные низкоранговые проекции и нормализация по длине кадра. MOTIVE позволяет выявлять обучающие клипы, которые действительно помогают модели лучше усваивать физику движения, включая прыжки, качение и динамику жидкостей. По результатам работы, fine-tuning на 10% данных, отобранных с помощью MOTIVE, работает на уровне или лучше, чем обучение на полном датасете. Это делает подход полезным для более эффективной курации данных и снижения затрат на обучение видеомоделей. Работа получила награду Outstanding Paper Honorable Mention на ICML 2026.

Источники 1
  • MOTIVE: метод отбора видео для обучения моделей движению gonzo-обзоры ML статей
    Умный отбор видео для обучения моделей физике движения. Если таким образом можно отфильтровать датасет так, что 10% отфильтрованного обучают модель лучше, чем полный датасет, то это биг дил! Для данных другой природы это всё тоже очень актуально.
    
    Motion Attribution for Video Generation
    Xindi Wu, Despoina Paschalidou, Jun Gao, Antonio Torralba, Laura Leal-Taixé, Olga Russakovsky, Sanja Fidler, Jonathan Lorraine
    Paper: https://arxiv.org/abs/2601.08828, ICML Submission
    Review: https://arxiviq.substack.com/p/motion-attribution-for-video-generation
    Project site: https://research.nvidia.com/labs/sil/projects/MOTIVE/
    Model: N/A
    
    ICML 2026 Outstanding Paper Honorable Mention
    
    # TL;DR
    
    ЧТО сделали: Авторы представили MOTIVE (MOTIon attribution for Video gEneration) — первый градиентный фреймворк для атрибуции данных, ориентированный исключительно на движение. Он разработан для современных крупномасштабных моделей видеодиффузии и flow-matching. Он успешно изолирует и сопоставляет временную динамику, а не статичный внешний вид, за счёт вычисления градиентов через взвешенные по движению маски потерь. Для масштабирования на миллиардные архитектуры применяются структурированные низкоранговые проекции и нормализация по длине кадра.
    
    ПОЧЕМУ это важно: Современные генераторы видео масштабируются за счёт гигантских объемов интернет-данных, но у нас нет инструментов, позволяющих понять, какие именно обучающие клипы учат модели физике (например, прыжкам, качению или динамике жидкостей). Разработанный исследователями из NVIDIA, Принстона и MIT фреймворк MOTIVE изолирует градиенты движения для точной курации данных. Файнтюнинг всего на 10% данных, отобранных с помощью MOTIVE, работает на уровне или лучше обучения на полном датасете. Это открывает эффективный путь к созданию физически согласованных моделей мира (world models).
    
    Для практиков: MOTIVE позволяет существенно сократить расходы на обучение видеомоделей и улучшить их физическую точность за счёт умной фильтрации обучающей выборки. Метод решает проблему кинетической слепоты существующих подходов к атрибуции, убирая избыточное влияние статичного фона и длины видео.
    
    Изучать движение тут:  https://t.me/gonzo_ML_podcasts/4404