SGLang 0.5.16 включает 574 пул-реквеста и 169 контрибьюторов. Главные новинки — механизм спекулятивного декодирования DSpark и поддержка Inkling.

SGLang 0.5.16: 574 пул-реквеста от 169 контрибьюторов. Основная новинка — DSpark, механизм спекулятивного декодирования, где размер окна проверки берётся из уверенности черновой модели, а не из фиксированной длины. На DeepSeek-V4-Pro в конфигурации TP8 на B300 заявлено 383,7 токена в секунду. Также добавлена поддержка Inkling: до 71,7 тысячи токенов в секунду на входе и 171 токен в секунду на декоде на Blackwell.

Источники 1
  • SGLang 0.5.16 добавил DSpark для спекулятивного декодирования и поддержку Inkling Нейроканал
    За выходные обновились почти все движки инференса разом, собрал в одном месте.
    
    vLLM 0.26.0: 411 коммитов от 212 контрибьюторов, 61 из них новички. Завезли поддержку семейства Inkling и пачку оптимизаций под DeepSeek-V4, где отдельное ядро роутинга даёт 2,94% к сквозному TPOT, а fused_topk_bias ускоряет ядро в 1,5–2 раза. Бэкенд внимания теперь выбирается отдельно для каждой группы KV-кеша, это нужно гибридным моделям.
    
    SGLang 0.5.16: 574 пул-реквеста от 169 контрибьюторов. Главное тут DSpark, спекулятивное декодирование, где размер окна проверки берётся из уверенности черновой модели, а не из фиксированной длины: 383,7 токена в секунду на DeepSeek-V4-Pro в конфигурации TP8 на B300. Inkling тоже поддержан, до 71,7 тысячи токенов в секунду на входе и 171 на декоде на Blackwell.
    
    Ollama 0.32.4: Laguna заработала на видеокартах Apple через движок MLX, починили декодирование Qwen3 MoE с разнокалиберными квантами экспертов, упакованная проекция gate/up ускорилась на 4–9% на M5 Max.
    
    llama.cpp: приехало зрение для MiniMax-M3. Разреженное внимание переписали на нативные CUDA-операции, а буфер вычислений ужали с 6,8 до 4,2 ГиБ.
    
    @neuro_channel