Исследователи из Google DeepMind, MIT и Оксфорда представили GenCeption — систему, которая использует модель генерации видео для задач компьютерного зрения. Она умеет определять глубину, сегментацию, отслеживание объектов и поз человека, обучаясь на 7,5 тыс. синтетических роликов.

Исследователи из Google DeepMind, MIT и Оксфорда представили GenCeption — систему, которая превращает модель генерации видео в универсальный инструмент компьютерного зрения. С помощью одной архитектуры модель решает задачи определения глубины сцены, сегментации объектов, восстановления положения камеры, отслеживания объектов и поз человека. Для дообучения команда использовала 7,5 тыс. синтетических роликов, созданных в Blender. В основе GenCeption лежит открытая видеомодель Wan 2.1. Авторы отмечают, что этого набора данных оказалось достаточно, чтобы система сравнялась или обошла несколько специализированных моделей, а в отдельных задачах потребовалось в 7–500 раз меньше данных. По словам исследователей, модель, обученная преимущественно на синтетических сценах с людьми, смогла работать и с реальными съёмками, животными и роботами. При этом GenCeption остаётся тяжёлой системой: версия на 14 млрд параметров обрабатывает 81 кадр примерно за 10 секунд на TPU и требует до 42,8 ГБ памяти. Авторы рассматривают GenCeption как доказательство того, что генерация видео может стать общим способом предобучения для компьютерного зрения, а не только инструментом создания роликов.

Источники 1
  • GenCeption превратила генерацию видео в универсальный инструмент компьютерного зрения anti_agi
    Генерирую, следовательно, вижу
    
    У компьютерного зрения до сих пор не было своей LLM. Определение глубины, сегментация объектов, восстановление положения камеры и отслеживание человеческого тела — всё это в CV обычно требует отдельных моделей.
    
    Их, конечно, можно собрать в одну систему. Но от этого они не начинают делиться знаниями: каждая по-своему представляет сцену, требует собственных размеченных данных, выходных модулей и настройки. 
    
    Решить проблему взялись исследователи Google DeepMind, MIT и Оксфорда — они превратили модель для генерации видео в универсальную систему компьютерного зрения. GenCeption умеет по одному ролику определять глубину сцены, положение камеры, границы объектов, направление поверхностей и координаты человеческого тела.
    
    В основе системы лежит открытая видеомодель Wan 2.1. 
    
    Для дообучения команда создала всего 7,5 тыс. синтетических роликов в Blender. В них использовали 800 цифровых персонажей, 200 движений, разные камеры, освещение и окружение. Вместе с видео движок сразу выдавал точную глубину, положение камеры, маски объектов и координаты тела.
    
    Этого оказалось достаточно, чтобы GenCeption сравнялась или обошла несколько специализированных систем. В отдельных задачах ей понадобилось в 7-500 раз меньше данных. Модель, обученная преимущественно на синтетических людях, смогла работать с реальными съёмками, животными и роботами.
    
    Авторы объясняют предобучением. Чтобы правдоподобно продолжать видео, генератору приходится неявно усвоить трёхмерную геометрию, постоянство объектов, движение и простейшие физические закономерности. Обычно эти знания нужны ему для создания следующего кадра. GenCeption заставляет использовать их в обратную сторону — чтобы понять уже показанную сцену.
    
    Впрочем, до полноценного «зрения общего назначения» ещё далеко. Сейчас это набор заранее заданных задач, сведённых к одной архитектуре. Модель также довольно тяжёлая: версия на 14 млрд параметров обрабатывает 81 кадр примерно за 10 секунд на TPU и требует до 42,8 ГБ памяти.
    
    Но это понимают и сами авторы. GenCeption для них — доказательство самой идеи: генерация видео может стать для компьютерного зрения общим способом предобучения, а не только инструментом производства роликов. Примерно как предсказание следующего слова когда-то оказалось полезно далеко за пределами продолжения текста.
    
    @anti_agi