Предложен метод Explorative Modeling (XM), который на каждом шаге обучения генерирует K кандидатов и обновляет градиенты только по лучшему, снижая размытие мод. Авторы сообщают об около-SOTA результатах на ImageNet 256x256 и заметном росте эффективности по FLOP, сэмплам и параметрам.

Авторы из университетов Иллинойса и Гарварда представили Explorative Modeling (XM) — новую парадигму предобучения генеративных моделей, которая переносит процесс поиска из этапа инференса в цикл обучения. Вместо развертывания генерации в сотни последовательных шагов XM генерирует K кандидатов на каждом шаге обучения и выполняет обратное распространение ошибки только через наилучшее совпадение. Подход помогает предотвратить mode blurring, характерное для традиционных реконструкционных генеративных моделей, и повышает генеративную выразительность. В экспериментах XM показал около-SOTA результаты, достигнув 1.43 unguided FID на ImageNet 256x256, а также улучшил FLOP-эффективность в 4.1 раза, эффективность по сэмплам — в 6.2 раза, а эффективность по параметрам — на 47%. В задачах робототехники и моделирования мира XM сравнивается с диффузионными моделями по качеству и требует в 16-256 раз меньше шагов инференса.

Источники 1
  • Explorative Modeling: новый метод предобучения генеративных моделей, переносящий поиск в цикл обучения gonzo-обзоры ML статей
    Прикольный метод улучшения генеративных моделей, которым надо работать с много-модальными распределениями (где много мод, а не модальностей). По дефолту MSE лосс сглаживает всё в одну моду, что на практике бесполезно и даже вредно, приводит к разблюренной серости (старые добрые проблемы с VAE были вроде бы точно такими же). 
    
    В предложенном методе Explorative Modeling (XM) эксплорейшн переносится на этап обучения (в отличие от медленного test-time эксплорейшна), когда генерятся несколько кандидатов, но бэкпроп потом делается только через лучшего. Метод идейно настолько простой, что задним умом удивительно, что его не использовали раньше.
    
    Авторы показали, что этот подход даёт ещё одну ось скейлинга и отлично дополняет скейлинг по данным и по параметрам. На следующем GTC Дженсен Хуанг будет рад нарисовать эту ещё одну ось, а в идеале скрестить и этот train-time scaling, и старый добрый test-time scaling. 
    
    Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation
    Alexi Gladstone, Heng Ji, Yilun Du
    Статья: https://arxiv.org/abs/2607.27372
    Ревью: https://arxiviq.substack.com/p/explorative-modeling-unlocking-a
    Код: https://github.com/alexiglad/XM
    Сайт: https://explorative-modeling.github.io/
    
    # TL;DR
    
    ЧТО сделали: Авторы представляют Explorative Modeling (XM) — новую парадигму предобучения генеративных моделей, которая переносит факторизацию из процесса генерации в цикл обучения. Генерируя K кандидатов (или сравнивая с K сэмплами данных) на каждом шаге обучения и прогоняя градиенты исключительно через наилучшее совпадение, XM предотвращают размытие мод (mode blurring), повышают генеративную выразительность и позволяют делать сквозную (end-to-end) генерацию за один проход.
    
    ПОЧЕМУ это важно: Традиционные реконструкционные генеративные модели полагаются на многошаговую факторизацию траектории при инференсе, что приводит к накоплению ошибок и сдвигу распределения (exposure bias). Explorative Modeling вводит генеративную выразительность как недостающую третью ось предобучения наряду с количеством параметров и размером датасета. Подход достигает около-SOTA результатов (1.43 unguided FID на ImageNet 256x256), улучшая FLOP-эффективность в 4.1 раза, эффективность по сэмплам в 6.2 раза и эффективность по параметрам на 47%. В робототехнике и моделировании мира XM сравниваются с диффузией по качеству, требуя в 16–256 раз меньше шагов инференса.
    
    Для практиков: Вместо того чтобы разворачивать генерацию в сотни последовательных шагов при инференсе, исследовательское моделирование переносит поиск внутрь цикла обучения. Совершая «выбор из K кандидатов» во время предобучения, модель фиксируется на конкретных модах, что позволяет свернуть инференс до одного прохода без потери покрытия мод. Выигрыш в эффективности не насыщается, а растёт с увеличением масштаба модели и объёма данных.
    
    Искать моды тут: https://t.me/gonzo_ML_podcasts/4731