Новость
DeepSeek 0731 на NVIDIA DGX Spark показал 67,6 токена в секунду на одиночном запросе
Автор бенчмарка сравнил разные runtime-образы и конфигурацию MoE-backend на двух NVIDIA DGX Spark. Переход на образ с vLLM 0.25.2 и явное включение --moe-backend flashinfer_b12x заметно повысили производительность.
DeepSeek 0731 протестировали на двух NVIDIA DGX Spark (GB10, SM121) с TP=2, драйвером 580.159.03 и подключением QSFP 200G / RoCEv2. В исследовании автор показал, что смена runtime-образа со сборки на базе vLLM 0.21.1 на образ с vLLM 0.25.2 дала около 22% прироста на том же чекпоинте. Отдельно отмечено, что параметр --moe-backend flashinfer_b12x не включается режимом auto. Его явное использование дало прирост 13,3% по среднему пяти прогонов на card-like профиле и 16,6% по медиане. Итоговый результат составил 67,6 tok/s на одиночном запросе и 260 tok/s суммарно на 12 параллельных запросах. В материале также разбираются отрицательные результаты, погрешности и границы применимости.
-
DeepSeek 0731 на NVIDIA DGX Spark показал 67,6 токена в секунду на одиночном запросе
Habr AI
DeepSeek 0731 на DGX Spark: разгоняю до 68 tok/s и разбираюсь, почему у автора карточки 57 TL;DR Железо: 2× NVIDIA DGX Spark (GB10, SM121), 128 GB unified номинально и около 122 GiB видимых системе на ноду, QSFP 200G / RoCEv2, TP=2, драйвер 580.159.03. Основную часть расхождения объяснила смена runtime‑образа. Переход со сборки на базе vLLM 0.21.1 на образ с 0.25.2 дал около +22% на том же чекпоинте. Конкретный коммит или компонент я не изолировал: поменялся весь пакет. Механика неочевидная: новый образ снизил расчётную частоту verification‑шагов примерно на 17%, но поднял число выходных токенов за шаг с 3.27 до 4.80. Главная находка в конфиге: --moe-backend flashinfer_b12x не выбирается режимом auto. Явное включение дало +13.3% по среднему пяти прогонов на card‑like профиле (59.7 против 67.6) и +16.6% по медиане. B12X работает иначе: поднимает SSE‑derived частоту verification‑шагов на 16–18%, при этом выходные токены за шаг снижаются примерно на 2.5% в обоих профилях. Итоговый прирост клиентской decode‑метрики составил 13.3–14.6% по средним и 15.6–16.6% по медианам. Итог: 67.6 tok/s на одиночном запросе, 260 tok/s суммарно на 12 параллельных запросов. Отрицательные результаты, погрешности и границы применимости вынесены в отдельные разделы. Читать далее #dgx_spark #vllm #llm_инференс #бенчмарк #спекулятивное_декодирование #gb10 #moe #локальные_нейросети #speculative_decoding #deepseek_0731 | @habr_ai