Новость
MIT предложил систему VLASH для ускорения работы роботов
Исследователи Массачусетского технологического института разработали систему VLASH, которая позволяет роботам планировать следующее движение, не прерывая выполнение текущего. По данным авторов, это снижает паузы и ускоряет выполнение задач в 1,5–2 раза без потери качества.
Исследователи Массачусетского технологического института (MIT) разработали систему VLASH, которая позволяет роботам планировать следующее движение, не останавливая выполнение предыдущего. В обычной схеме робот сначала анализирует изображение и команду, затем выполняет серию действий, а после этого снова переходит к расчётам, из-за чего возникают паузы. VLASH помогает учитывать, что робот продолжает двигаться, пока модель думает: система заранее прогнозирует будущие положения и под них рассчитывает следующую команду. Для этого модель дополнительно обучали на одном и том же изображении с разными будущими положениями робота и соответствующими действиями. Также несколько мелких движений объединяли в одно более крупное, чтобы ускорить выполнение траектории. Метод протестировали с несколькими VLA-моделями, включая π0.5 от Physical Intelligence, GR00T N1.6 от NVIDIA и SmolVLA от Hugging Face, а также на двуруком роботе Galaxea R1 Lite и манипуляторе LeRobot SO-101. В задачах перекладывания, сортировки и складывания кубиков система показала ускорение в 1,5–2 раза без ухудшения результата, а максимальная задержка реакции сократилась до 11,8 раза.
-
MIT предложил систему VLASH для ускорения работы роботов
anti_agi
Роботам опять предлагают думать Исследователи Массачусетского технологического университета (MIT) разработали систему VLASH, которая позволяет роботам планировать следующее движение, не останавливая выполнение предыдущего. Как это происходит обычно: робот получает изображение с камеры и команду, рассчитывает серию действий, выполняет её — и только после этого снова принимается за анализ и формирование новой команды. Отсюда возникают паузы. Запустить расчёты параллельно с движением можно и без VLASH, но появляется другая проблема: пока модель размышляет, рука уже успевает переместиться. В итоге новая команда рассчитана для положения, в котором робота больше нет, и движения становятся дёргаными 👆🏻 VLASH заранее прокручивает уже запланированные действия и вычисляет, какое положение нужно занять к моменту выполнения следующей команды. Чтобы модель действительно учитывала эти данные, её дополнительно обучали на одном и том же изображении, но с разными будущими положениями робота и соответствующими действиями. А для дальнейшего ускорения несколько мелких движений объединяли в одно крупное: вместо десятка коротких шажков манипулятор сразу переходил к следующей важной точке траектории. Метод проверили с несколькими VLA-моделями, включая π0.5 от Physical Intelligence, GR00T N1.6 от NVIDIA и SmolVLA от Hugging Face, а также на двуруком роботе Galaxea R1 Lite и небольшом манипуляторе LeRobot SO-101. При перекладывании, сортировке и складывании кубиков задачи выполнялись в 1,5-2 раза быстрее без ухудшения результата, а максимальная задержка реакции сократилась до 11,8 раза. Для наглядности робота отправили играть в пинг-понг: стандартная VLA-модель, которая рассчитывает движения и только потом их выполняет, не отбила ни одной из двадцати подач. VLASH же справился с одиннадцатью. Ещё система заметно лучше показала себя в игре Whac-A-Mole (это та, где надо успевать ударить крота по темечку) — но это уже другой вопрос, насколько достойно мы применяем большие языковые модели. @anti_robots