Новость
SenseTime открыла веса модели компьютерного зрения SenseNova-Vision
SenseTime выпустила открытую мультимодальную модель SenseNova-Vision с единым генеративным интерфейсом для задач компьютерного зрения. Модель решает детекцию, сегментацию и оценку глубины через генерацию текста и изображений, но уступает специализированным решениям в 3D-геометрии и распознавании русского текста.
SenseTime открыла веса единой модели зрения SenseNova-Vision. В отличие от традиционного подхода, где под каждую задачу компьютерного зрения строят отдельные системы, модель решает разные задачи — от детекции объектов до оценки глубины сцены — через генерацию текста, изображений или их комбинации. В основе SenseNova-Vision лежит открытая мультимодальная модель Bagel-7B-MoT от ByteDance. Модель дообучена без изменения архитектуры. Вместе с ней опубликован корпус SN-VC-50M на 50 млн примеров, собранный из открытых наборов. По результатам тестов SenseNova-Vision лидирует в детекции, включая плотные сцены, а также в локализации текста и ключевых точек. При этом она близка к лучшим генеративным методам по глубине и нормалям, но отстаёт от специализированных VGGT и Depth Anything 3 в 3D-геометрии и хуже распознаёт русский текст. Лицензия — CC-BY-NC-4.0.
-
SenseTime открыла веса модели компьютерного зрения SenseNova-Vision
Machinelearning
🌟 SenseNova-Vision: CV-комбайн в едином генеративном интерфейсе SenseTime открыла веса единой модели зрения SenseNova-Vision. Обычно под каждую задачу (найти объекты, выделить их контуры, оценить глубину сцены) строят отдельную систему или встраивают в модель специальный модуль. Здесь от этого отказались - все задачи модель решает как генерацию текста, картинки или их смеси. Компания основана в 2014 году и выросла из университетской лаборатории MMLab - оттуда вышла заметная часть китайских специалистов по компьютерному зрению. Известность пришла в 2015-м, когда алгоритм распознавания лиц SenseTime обошёл по точности человеческий глаз. В 2026 году Gartner назвала компанию визионером в генеративном CV. 🟡Механика Рамки объектов и распознанный текст модель выдаёт текстом с координатами, карты глубины и нормалей поверхностей - картинками, а сложную сегментацию - смешанным ответом, где текстовая легенда задаёт цвета маски. Авторы сравнивают подход с тем, что GPT сделал для текста: вместо зоопарка специализированных систем - один генеративный интерфейс. Под капотом - открытая мультимодальная модель Bagel-7B-MoT от ByteDance, дообученная без изменений архитектуры. MoT - это смесь трансформеров. Внутри модели живут 2 эксперта с собственными весами - один отвечает за понимание текста и изображений, второй за генерацию картинок, а внимание у них общее, так что оба смотрят на один контекст. Токены распределяются между экспертами жёстко, по типу данных, а не обучаемым маршрутизатором, как в MoE. Для SenseNova-Vision такое устройство пришлось кстати - модель чередует текстовые ответы вроде координат и картиночные вроде масок, и у каждой ветки свой набор весов. 🟡Тесты SenseNova-Vision лидирует среди сопоставимых систем там, где ответ - структурированный текст (детекция, в том числе в плотных сценах с десятками объектов, локализация текста на изображении, ключевые точки). В оценке глубины и нормалей она близка к лучшим генеративным методам, в сегментации держится на уровне конкурентов. Слабые места тоже есть. В многовидовой 3D-геометрии модель отстаёт от специализированных VGGT и Depth Anything 3, а текст на русском распознаёт заметно хуже, чем на английском. Вместе с моделью опубликован корпус SN-VC-50M - 50 млн обучающих примеров из открытых наборов: 18,9 млн кадров для структурного понимания, 17,3 млн для плотной геометрии, 12,5 млн для многовидовой геометрии и 1,3 млн для сегментации. 📌Лицензирование: CC-BY-NC-4.0 🟡Модель 🟡Arxiv 🟡Датасет 🟡Демо 🖥GitHub @ai_machinelearning_big_data #AI #ML #СV #MoT #SenseNovaVision #SenseTime