Новость
Cursor выложила в открытый доступ ядро Mixture-of-Kittens для ускорения обучения MoE-моделей
Cursor опубликовала открытое ядро Mixture-of-Kittens (MoK) для обучения MoE-моделей. По данным компании, оно ускоряет обучение до 2,37 раза по сравнению с лучшими публичными решениями и уже используется для тренировки Composer.
Cursor выложила в open source Mixture-of-Kittens (MoK) — крупное GPU-ядро для обучения MoE-моделей на стойках Nvidia GB300 NVL72. В нём вся пересылка данных между 72 видеокартами и вычисления MoE-слоя выполняются одним ядром. По замерам компании, MoK работает до 2,37 раза быстрее лучших публичных решений. В продакшене оно также подняло сквозную скорость обучения на 41% — с 761 до 1070 токенов в секунду на видеокарту. На этом ядре Cursor уже обучает модель Composer на десятках тысяч GPU.
Источники
1
-
Cursor выложила в открытый доступ ядро Mixture-of-Kittens для ускорения обучения MoE-моделей
Habr AI
«Смесь котят»: как Cursor создал открытое ядро, ускоряющее обучение ИИ до 2.4 раз Компания Cursor выложила в опенсорс Mixture-of-Kittens (MoK) — "мегаядро" для обучения MoE-моделей на стойках Nvidia GB300 NVL72. Вся пересылка данных между 72 видеокартами и все вычисления MoE-слоя в нем выполняются одним гигантским GPU-ядром. По замерам самой компании, MoK работает до 2.37 раза быстрее лучших публичных решений, а в продакшене поднял сквозную скорость обучения на 41%: с 761 до 1070 токенов в секунду на видеокарту. На этом ядре Cursor уже обучает свою модель Composer на десятках тысяч GPU. Читать далее #cursor #cursor_composer_2_5 #composer_2_5 | @habr_ai