AMD совместно с Moonshot AI пересобрали серверный стек под агентные нагрузки на GPU AMD Instinct. Решение UMBP оптимизирует управление KV-кешем и, по заявлению авторов, снижает задержку первого токена до 3,2 раза и увеличивает выпуск токенов на 7,7%.

AMD вместе с Moonshot AI рассказали, как с нуля пересобрали серверный стек под агентские нагрузки на GPU AMD Instinct. Классические стеки обслуживания LLM проектировались под чат-сценарии, где модель отвечает на отдельный запрос, тогда как агентские сессии длиннее, многоходовее и часто ждут результат вызова инструмента. Ключевой элемент решения — UMBP. Он ведёт единый каталог KV-кеша по уровням памяти и узлам кластера, а также передаёт планировщику данные о том, где находится блок, насколько он горячий и сколько стоит его извлечь. Это позволяет выбирать между пересчётом контекста и переносом готового кеша по сети с соседнего узла. По заявлению авторов, p99-задержка первого токена снизилась до 3,2 раза, а общий выпуск токенов вырос на 7,7%. Отдельно отмечается, что для агентов важна задержка всего хода целиком, а не только стриминг ответа между вызовами инструментов.

Источники 1
  • AMD и Moonshot AI представили UMBP для агентных нагрузок на GPU Instinct Нейроканал
    AMD вместе с Moonshot AI (это создатели Kimi) рассказали, как с нуля пересобрали серверный стек под агентские нагрузки на GPU AMD Instinct.
    
    Классические стеки обслуживания LLM проектировались под чат: человек написал, модель ответила, все ждут первый токен. Агентские сессии вроде Claude Code устроены иначе. Они длинные и многоходовые, контекст растёт с каждым ходом, большую часть времени агент ждёт результат вызова инструмента, а короткоживущие субагенты прилетают пачками. Экономику такой нагрузки определяет KV-кеш, служебная память обо всём предыдущем контексте: сколько его получается переиспользовать и где он лежит, когда перестаёт помещаться в видеопамять.
    
    Ядро решения называется UMBP. Обычно при вытеснении кеша из видеопамяти в оперативную или на SSD планировщик теряет его из виду: хранилище отвечает на вопрос «есть ли такой префикс», но молчит о том, кто отдаст его быстрее всех. UMBP ведёт единый каталог кеша по всем уровням памяти и узлам кластера и делится с планировщиком статистикой: где лежит блок, насколько он горячий, сколько стоит его достать. По этим данным планировщик выбирает: пересчитать контекст заново или притащить готовый кеш по сети с соседнего узла.
    
    Заявленные результаты: p99-задержка первого токена ниже до 3,2 раза, общий выпуск токенов вырос на 7,7%. Отдельное наблюдение авторов: для агентов важна задержка всего хода целиком, ведь стриминг ответа между вызовами инструментов никто не читает.
    
    💻 Всё это работа ML-инфраструктуры: развернуть модель, следить за ней и не дать продакшну упасть. Освоить её можно на курсе «MLOps для разработки и мониторинга моделей» в Практикуме PRO: Docker и Kubernetes, CI/CD для ML, деплой и масштабирование.
    
    @neuro_channel