Исследователи Массачусетского технологического института разработали систему VLASH, которая позволяет роботам планировать следующее движение, не прерывая выполнение текущего. По данным авторов, это снижает паузы и ускоряет выполнение задач в 1,5–2 раза без потери качества.

Исследователи Массачусетского технологического института (MIT) разработали систему VLASH, которая позволяет роботам планировать следующее движение, не останавливая выполнение предыдущего. В обычной схеме робот сначала анализирует изображение и команду, затем выполняет серию действий, а после этого снова переходит к расчётам, из-за чего возникают паузы. VLASH помогает учитывать, что робот продолжает двигаться, пока модель думает: система заранее прогнозирует будущие положения и под них рассчитывает следующую команду. Для этого модель дополнительно обучали на одном и том же изображении с разными будущими положениями робота и соответствующими действиями. Также несколько мелких движений объединяли в одно более крупное, чтобы ускорить выполнение траектории. Метод протестировали с несколькими VLA-моделями, включая π0.5 от Physical Intelligence, GR00T N1.6 от NVIDIA и SmolVLA от Hugging Face, а также на двуруком роботе Galaxea R1 Lite и манипуляторе LeRobot SO-101. В задачах перекладывания, сортировки и складывания кубиков система показала ускорение в 1,5–2 раза без ухудшения результата, а максимальная задержка реакции сократилась до 11,8 раза.

Источники 1
  • MIT предложил систему VLASH для ускорения работы роботов anti_agi
    Роботам опять предлагают думать
    
    Исследователи Массачусетского технологического университета (MIT) разработали систему VLASH, которая позволяет роботам планировать следующее движение, не останавливая выполнение предыдущего. Как это происходит обычно: робот получает изображение с камеры и команду, рассчитывает серию действий, выполняет её — и только после этого снова принимается за анализ и формирование новой команды. Отсюда возникают паузы.
    
    Запустить расчёты параллельно с движением можно и без VLASH, но появляется другая проблема: пока модель размышляет, рука уже успевает переместиться. В итоге новая команда рассчитана для положения, в котором робота больше нет, и движения становятся дёргаными 👆🏻 VLASH заранее прокручивает уже запланированные действия и вычисляет, какое положение нужно занять к моменту выполнения следующей команды.
    
    Чтобы модель действительно учитывала эти данные, её дополнительно обучали на одном и том же изображении, но с разными будущими положениями робота и соответствующими действиями. А для дальнейшего ускорения несколько мелких движений объединяли в одно крупное: вместо десятка коротких шажков манипулятор сразу переходил к следующей важной точке траектории.
    
    Метод проверили с несколькими VLA-моделями, включая π0.5 от Physical Intelligence, GR00T N1.6 от NVIDIA и SmolVLA от Hugging Face, а также на двуруком роботе Galaxea R1 Lite и небольшом манипуляторе LeRobot SO-101. При перекладывании, сортировке и складывании кубиков задачи выполнялись в 1,5-2 раза быстрее без ухудшения результата, а максимальная задержка реакции сократилась до 11,8 раза.
    
    Для наглядности робота отправили играть в пинг-понг: стандартная VLA-модель, которая рассчитывает движения и только потом их выполняет, не отбила ни одной из двадцати подач. VLASH же справился с одиннадцатью. Ещё система заметно лучше показала себя в игре Whac-A-Mole (это та, где надо успевать ударить крота по темечку) — но это уже другой вопрос, насколько достойно мы применяем большие языковые модели.
    
    @anti_robots