Разработчик JustVugg представил движок Colibri, который позволяет запускать модель GLM-5.2 с 744 млрд параметров на обычном ноутбуке с 25 ГБ оперативной памяти. Для этого эксперты подгружаются с NVMe-накопителя по требованию.

Энтузиаст под ником JustVugg представил движок Colibri, который запускает открытую модель GLM-5.2 от китайской компании Z.ai с 744 миллиардами параметров на компьютере с 25 ГБ оперативной памяти. В обычном подходе даже 2-битный квант требует около 220 ГБ, а в этом случае плотная часть модели занимает 9,9 ГБ в int4-кванте, а 21 504 маршрутизируемых эксперта хранятся на NVMe и подгружаются по требованию. Модель не дистиллирована, веса сжаты до 4 бит. На каждый токен опрашивается 8 экспертов в 75 MoE-слоях, что даёт около 11 ГБ чтения с диска. Скорость генерации составляет от 0,05 токена в секунду. Проект набрал более двух тысяч звёзд на GitHub.

Источники 1
  • Энтузиаст запустил GLM-5.2 на ноутбуке с 25 ГБ ОЗУ Habr AI
    Энтузиаст запустил GLM-5.2 на ноутбуке с 25 ГБ RAM: без дистилляции, но на скорости от 0,05 токена в секунду
    
    Разработчик-одиночка под ником JustVugg представил Colibri — движок, который запускает открытую модель GLM-5.2 с 744 миллиардами параметров на обычном компьютере с 25 ГБ оперативной памяти. Для сравнения, даже 2-битный квант моделей этого семейства требует порядка 220 ГБ памяти. На момент написания текста проект собрал более двух тысяч звезд на GitHub.
    
    GLM-5.2 — флагманская открытая модель китайской Z.ai, веса опубликованы под лицензией MIT: 744 миллиарда параметров всего, из них около 40 миллиардов активных на токен, контекст до миллиона токенов. На кодинг-бенчмарках она считается сильнейшей открытой моделью, которая "дышит" в спину закрытым конкурентам вроде Opus 4.8 и GPT-5.5. Проблема в том, что при классическом подходе все веса модели должны находиться в памяти одновременно — отсюда минимум для запуска в сотни гигабайт.
    
    Ключевое наблюдение автора Colibri: в MoE-архитектуре от токена к токену реально меняется лишь малая часть задействованных весов. Плотная часть модели — внимание, эмбеддинги и общие эксперты, около 17 миллиардов параметров — постоянно находится в памяти в int4-кванте и занимает 9,9 ГБ. А 21 504 маршрутизируемых эксперта, каждый примерно по 19 МБ, лежат на NVMe-накопителе (около 370 ГБ) и подгружаются по требованию. 
    
    Важная оговорка: модель не урезана и не дистиллирована, все 744 миллиарда параметров на месте, но веса сжаты до 4 бит — это тот же компромисс, что и у привычных квантов GGUF.  На каждый новый токен модель опрашивает 8 экспертов в каждом из 75 MoE-слоев, так что без прогретого кэша один токен обходится примерно в 11 ГБ прочитанных с диска данных (о том, как это влияет на износ — дальше по тексту). Читать далее
    
    #glm_5_2 #z_ai #glm | @habr_ai