Новость
llama.cpp добавил зрение для MiniMax-M3 и оптимизировал разреженное внимание
В llama.cpp появилась поддержка зрения для MiniMax-M3. Разреженное внимание переписали на нативные CUDA-операции, а буфер вычислений сократили с 6,8 до 4,2 ГиБ.
llama.cpp: добавлено зрение для MiniMax-M3. Разреженное внимание переписали на нативные CUDA-операции, а буфер вычислений сократили с 6,8 до 4,2 ГиБ.
Источники
1
-
llama.cpp добавил зрение для MiniMax-M3 и оптимизировал разреженное внимание
Нейроканал
За выходные обновились почти все движки инференса разом, собрал в одном месте. vLLM 0.26.0: 411 коммитов от 212 контрибьюторов, 61 из них новички. Завезли поддержку семейства Inkling и пачку оптимизаций под DeepSeek-V4, где отдельное ядро роутинга даёт 2,94% к сквозному TPOT, а fused_topk_bias ускоряет ядро в 1,5–2 раза. Бэкенд внимания теперь выбирается отдельно для каждой группы KV-кеша, это нужно гибридным моделям. SGLang 0.5.16: 574 пул-реквеста от 169 контрибьюторов. Главное тут DSpark, спекулятивное декодирование, где размер окна проверки берётся из уверенности черновой модели, а не из фиксированной длины: 383,7 токена в секунду на DeepSeek-V4-Pro в конфигурации TP8 на B300. Inkling тоже поддержан, до 71,7 тысячи токенов в секунду на входе и 171 на декоде на Blackwell. Ollama 0.32.4: Laguna заработала на видеокартах Apple через движок MLX, починили декодирование Qwen3 MoE с разнокалиберными квантами экспертов, упакованная проекция gate/up ускорилась на 4–9% на M5 Max. llama.cpp: приехало зрение для MiniMax-M3. Разреженное внимание переписали на нативные CUDA-операции, а буфер вычислений ужали с 6,8 до 4,2 ГиБ. @neuro_channel