SenseTime выпустила открытую мультимодальную модель SenseNova-Vision с единым генеративным интерфейсом для задач компьютерного зрения. Модель решает детекцию, сегментацию и оценку глубины через генерацию текста и изображений, но уступает специализированным решениям в 3D-геометрии и распознавании русского текста.

SenseTime открыла веса единой модели зрения SenseNova-Vision. В отличие от традиционного подхода, где под каждую задачу компьютерного зрения строят отдельные системы, модель решает разные задачи — от детекции объектов до оценки глубины сцены — через генерацию текста, изображений или их комбинации. В основе SenseNova-Vision лежит открытая мультимодальная модель Bagel-7B-MoT от ByteDance. Модель дообучена без изменения архитектуры. Вместе с ней опубликован корпус SN-VC-50M на 50 млн примеров, собранный из открытых наборов. По результатам тестов SenseNova-Vision лидирует в детекции, включая плотные сцены, а также в локализации текста и ключевых точек. При этом она близка к лучшим генеративным методам по глубине и нормалям, но отстаёт от специализированных VGGT и Depth Anything 3 в 3D-геометрии и хуже распознаёт русский текст. Лицензия — CC-BY-NC-4.0.

Источники 1
  • SenseTime открыла веса модели компьютерного зрения SenseNova-Vision Machinelearning
    🌟 SenseNova-Vision: CV-комбайн в едином генеративном интерфейсе
    
    SenseTime открыла веса единой модели зрения SenseNova-Vision. Обычно под каждую задачу (найти объекты, выделить их контуры, оценить глубину сцены) строят отдельную систему или встраивают в модель специальный модуль. Здесь от этого отказались - все задачи модель решает как генерацию текста, картинки или их смеси.
    
    Компания основана в 2014 году и выросла из университетской лаборатории MMLab - оттуда вышла заметная часть китайских специалистов по компьютерному зрению. Известность пришла в 2015-м, когда алгоритм распознавания лиц SenseTime обошёл по точности человеческий глаз. В 2026 году Gartner назвала компанию визионером в генеративном CV.
    
    🟡Механика
    
    Рамки объектов и распознанный текст модель выдаёт текстом с координатами, карты глубины и нормалей поверхностей - картинками, а сложную сегментацию - смешанным ответом, где текстовая легенда задаёт цвета маски.
    
    Авторы сравнивают подход с тем, что GPT сделал для текста: вместо зоопарка специализированных систем - один генеративный интерфейс.
    
    Под капотом - открытая мультимодальная модель Bagel-7B-MoT от ByteDance, дообученная без изменений архитектуры.
    
    MoT - это смесь трансформеров. Внутри модели живут 2 эксперта с собственными весами - один отвечает за понимание текста и изображений, второй за генерацию картинок, а внимание у них общее, так что оба смотрят на один контекст. Токены распределяются между экспертами жёстко, по типу данных, а не обучаемым маршрутизатором, как в MoE.
    
    Для SenseNova-Vision такое устройство пришлось кстати - модель чередует текстовые ответы вроде координат и картиночные вроде масок, и у каждой ветки свой набор весов.
    
    🟡Тесты
    
    SenseNova-Vision лидирует среди сопоставимых систем там, где ответ - структурированный текст (детекция, в том числе в плотных сценах с десятками объектов, локализация текста на изображении, ключевые точки).
    
    В оценке глубины и нормалей она близка к лучшим генеративным методам, в сегментации держится на уровне конкурентов.
    
    Слабые места тоже есть. В многовидовой 3D-геометрии модель отстаёт от специализированных VGGT и Depth Anything 3, а текст на русском распознаёт заметно хуже, чем на английском.
    
    Вместе с моделью опубликован корпус SN-VC-50M - 50 млн обучающих примеров из открытых наборов: 18,9 млн кадров для структурного понимания, 17,3 млн для плотной геометрии, 12,5 млн для многовидовой геометрии и 1,3 млн для сегментации.
    
    
    📌Лицензирование: CC-BY-NC-4.0 
    
    
    🟡Модель
    🟡Arxiv
    🟡Датасет
    🟡Демо
    🖥GitHub 
    
    
    @ai_machinelearning_big_data
    
    #AI #ML #СV #MoT #SenseNovaVision #SenseTime