Новость
AMD и Moonshot AI представили UMBP для агентных нагрузок на GPU Instinct
AMD совместно с Moonshot AI пересобрали серверный стек под агентные нагрузки на GPU AMD Instinct. Решение UMBP оптимизирует управление KV-кешем и, по заявлению авторов, снижает задержку первого токена до 3,2 раза и увеличивает выпуск токенов на 7,7%.
AMD вместе с Moonshot AI рассказали, как с нуля пересобрали серверный стек под агентские нагрузки на GPU AMD Instinct. Классические стеки обслуживания LLM проектировались под чат-сценарии, где модель отвечает на отдельный запрос, тогда как агентские сессии длиннее, многоходовее и часто ждут результат вызова инструмента. Ключевой элемент решения — UMBP. Он ведёт единый каталог KV-кеша по уровням памяти и узлам кластера, а также передаёт планировщику данные о том, где находится блок, насколько он горячий и сколько стоит его извлечь. Это позволяет выбирать между пересчётом контекста и переносом готового кеша по сети с соседнего узла. По заявлению авторов, p99-задержка первого токена снизилась до 3,2 раза, а общий выпуск токенов вырос на 7,7%. Отдельно отмечается, что для агентов важна задержка всего хода целиком, а не только стриминг ответа между вызовами инструментов.
-
AMD и Moonshot AI представили UMBP для агентных нагрузок на GPU Instinct
Нейроканал
AMD вместе с Moonshot AI (это создатели Kimi) рассказали, как с нуля пересобрали серверный стек под агентские нагрузки на GPU AMD Instinct. Классические стеки обслуживания LLM проектировались под чат: человек написал, модель ответила, все ждут первый токен. Агентские сессии вроде Claude Code устроены иначе. Они длинные и многоходовые, контекст растёт с каждым ходом, большую часть времени агент ждёт результат вызова инструмента, а короткоживущие субагенты прилетают пачками. Экономику такой нагрузки определяет KV-кеш, служебная память обо всём предыдущем контексте: сколько его получается переиспользовать и где он лежит, когда перестаёт помещаться в видеопамять. Ядро решения называется UMBP. Обычно при вытеснении кеша из видеопамяти в оперативную или на SSD планировщик теряет его из виду: хранилище отвечает на вопрос «есть ли такой префикс», но молчит о том, кто отдаст его быстрее всех. UMBP ведёт единый каталог кеша по всем уровням памяти и узлам кластера и делится с планировщиком статистикой: где лежит блок, насколько он горячий, сколько стоит его достать. По этим данным планировщик выбирает: пересчитать контекст заново или притащить готовый кеш по сети с соседнего узла. Заявленные результаты: p99-задержка первого токена ниже до 3,2 раза, общий выпуск токенов вырос на 7,7%. Отдельное наблюдение авторов: для агентов важна задержка всего хода целиком, ведь стриминг ответа между вызовами инструментов никто не читает. 💻 Всё это работа ML-инфраструктуры: развернуть модель, следить за ней и не дать продакшну упасть. Освоить её можно на курсе «MLOps для разработки и мониторинга моделей» в Практикуме PRO: Docker и Kubernetes, CI/CD для ML, деплой и масштабирование. @neuro_channel