Новость
GenCeption превратила генерацию видео в универсальный инструмент компьютерного зрения
Исследователи из Google DeepMind, MIT и Оксфорда представили GenCeption — систему, которая использует модель генерации видео для задач компьютерного зрения. Она умеет определять глубину, сегментацию, отслеживание объектов и поз человека, обучаясь на 7,5 тыс. синтетических роликов.
Исследователи из Google DeepMind, MIT и Оксфорда представили GenCeption — систему, которая превращает модель генерации видео в универсальный инструмент компьютерного зрения. С помощью одной архитектуры модель решает задачи определения глубины сцены, сегментации объектов, восстановления положения камеры, отслеживания объектов и поз человека. Для дообучения команда использовала 7,5 тыс. синтетических роликов, созданных в Blender. В основе GenCeption лежит открытая видеомодель Wan 2.1. Авторы отмечают, что этого набора данных оказалось достаточно, чтобы система сравнялась или обошла несколько специализированных моделей, а в отдельных задачах потребовалось в 7–500 раз меньше данных. По словам исследователей, модель, обученная преимущественно на синтетических сценах с людьми, смогла работать и с реальными съёмками, животными и роботами. При этом GenCeption остаётся тяжёлой системой: версия на 14 млрд параметров обрабатывает 81 кадр примерно за 10 секунд на TPU и требует до 42,8 ГБ памяти. Авторы рассматривают GenCeption как доказательство того, что генерация видео может стать общим способом предобучения для компьютерного зрения, а не только инструментом создания роликов.
-
GenCeption превратила генерацию видео в универсальный инструмент компьютерного зрения
anti_agi
Генерирую, следовательно, вижу У компьютерного зрения до сих пор не было своей LLM. Определение глубины, сегментация объектов, восстановление положения камеры и отслеживание человеческого тела — всё это в CV обычно требует отдельных моделей. Их, конечно, можно собрать в одну систему. Но от этого они не начинают делиться знаниями: каждая по-своему представляет сцену, требует собственных размеченных данных, выходных модулей и настройки. Решить проблему взялись исследователи Google DeepMind, MIT и Оксфорда — они превратили модель для генерации видео в универсальную систему компьютерного зрения. GenCeption умеет по одному ролику определять глубину сцены, положение камеры, границы объектов, направление поверхностей и координаты человеческого тела. В основе системы лежит открытая видеомодель Wan 2.1. Для дообучения команда создала всего 7,5 тыс. синтетических роликов в Blender. В них использовали 800 цифровых персонажей, 200 движений, разные камеры, освещение и окружение. Вместе с видео движок сразу выдавал точную глубину, положение камеры, маски объектов и координаты тела. Этого оказалось достаточно, чтобы GenCeption сравнялась или обошла несколько специализированных систем. В отдельных задачах ей понадобилось в 7-500 раз меньше данных. Модель, обученная преимущественно на синтетических людях, смогла работать с реальными съёмками, животными и роботами. Авторы объясняют предобучением. Чтобы правдоподобно продолжать видео, генератору приходится неявно усвоить трёхмерную геометрию, постоянство объектов, движение и простейшие физические закономерности. Обычно эти знания нужны ему для создания следующего кадра. GenCeption заставляет использовать их в обратную сторону — чтобы понять уже показанную сцену. Впрочем, до полноценного «зрения общего назначения» ещё далеко. Сейчас это набор заранее заданных задач, сведённых к одной архитектуре. Модель также довольно тяжёлая: версия на 14 млрд параметров обрабатывает 81 кадр примерно за 10 секунд на TPU и требует до 42,8 ГБ памяти. Но это понимают и сами авторы. GenCeption для них — доказательство самой идеи: генерация видео может стать для компьютерного зрения общим способом предобучения, а не только инструментом производства роликов. Примерно как предсказание следующего слова когда-то оказалось полезно далеко за пределами продолжения текста. @anti_agi