Исследователи из Meta представили CrossBERT — двудольную архитектуру, которая разделяет обучение представлений и реконструкцию токенов. Авторы утверждают, что это помогает избежать деградации качества эмбеддингов при масштабировании, характерной для BERT-подобных моделей.

Исследователи из Meta представили CrossBERT — двудольную (bipartite) архитектуру текстового энкодера, в которой обучение репрезентаций и реконструкция токенов разделены. Для формирования представлений используется глубокий энкодер, а для реконструкции — лёгкий предиктор на базе кросс-аттеншена. Авторы отмечают, что в традиционных BERT-подобных моделях финальные слои при росте масштаба могут деградировать, поскольку одновременно решают задачи понимания семантики и восстановления локального токена. В CrossBERT эта проблема, по утверждению исследователей, устраняется за счёт разделения целей. Также в работе описана стратегия Complementary Masking Strategy (CMS), которая ускоряет обучение и позволяет использовать высокую долю маскирования — 50% и выше. По словам авторов, замороженные репрезентации CrossBERT не уступают или превосходят полноценно дообученные бейзлайны в задачах поиска и семантического анализа. Модель рассматривается как вариант для плотного поиска документов, семантического поиска и RAG, где важно использовать сильный текстовый бэкбон без дорогостоящего файнтюнинга.

Источники 1
  • CrossBERT: новая архитектура текстового энкодера от команды Яна Лекуна gonzo-обзоры ML статей
    Соскучились по Берту? Лекун не дремлет!
    
    Проблема с традиционным Бертом и его новомодными улучшениями (мы разбирали ModernBERT, https://t.me/gonzo_ML/3090) в том, что с ростом модели репрезентации финальных слоёв контринтуитивно деградируют и бесполезны для множества реальных задач. А всё потому, что они работают на две цели одновременно: понимание высокоуровневой семантики и восстановление локального токена. Если цели разделить (что в работе и сделали), то становится всё хорошо. Лекун и ко улучшили репрезентации!
    
    Separating Representation from Reconstruction Enables Scalable Text Encoders
    Megi Dervishi, Mathurin Videau, Yann LeCun
    Paper: https://arxiv.org/abs/2607.04011
    Review: https://arxiviq.substack.com/p/separating-representation-from-reconstruction
    Code: https://github.com/facebookresearch/lingua
    Model: N/A
    
    # TL;DR
    
    ЧТО сделали: Авторы представили CrossBERT — новую двудольную (bipartite) архитектуру текстового энкодера, которая полностью разделяет обучение репрезентаций и реконструкцию токенов. Благодаря использованию глубокого энкодера для формирования представлений и лёгкого предиктора исключительно на базе кросс-аттеншена (cross-attention) для реконструкции, CrossBERT позволяет использовать высокую долю маскирования (≥ 50%). Вместе с этим исследователи внедрили параллельную стратегию комплементарного маскирования (Complementary Masking Strategy, CMS), которая кардинально ускоряет обучение и гарантирует монотонный рост качества репрезентаций по мере масштабирования.
    
    ПОЧЕМУ это важно: Стандартные плоские двунаправленные энкодеры, обучаемые через Masked Language Modeling (MLM) (такие как классический BERT), страдают от серьёзной деградации качества репрезентаций при увеличении масштаба. Это происходит потому, что их финальные слои слишком сильно специализируются на восстановлении локальных токенов из словаря вместо того, чтобы сохранять высокоуровневую семантику. CrossBERT изящно решает это структурное узкое горлышко. Теперь текстовые эмбеддинги предсказуемо масштабируются с ростом вычислений, а замороженные репрезентации не уступают или даже превосходят полноценно дообученные бейзлайны в задачах поиска и семантического анализа.
    
    Для практиков: CrossBERT открывает возможность использовать мощные замороженные текстовые бэкбоны для таких задач, как плотный поиск документов (dense passage retrieval), семантический поиск и RAG. Это избавляет от необходимости дорогостоящего и сложного файнтюнинга под конкретные задачи на инференсе, предлагая при этом ускорение пропускной способности данных до 1.68x.
    
    Улучшать Берт здесь: https://t.me/gonzo_ML_podcasts/4574