Moonshot AI представила архитектуру Kimi K3 с 93 слоями, новым механизмом внимания KDA и улучшенной MoE. Модель поддерживает контекст до миллиона токенов и, по оценке компании, заметно повышает эффективность масштабирования.

Moonshot AI опубликовала технический отчёт о модели Kimi K3. Архитектура K3 отличается от предыдущей K2: вместо 61 слоя с единым механизмом внимания MLA в K3 используются 93 слоя, организованные блоками с KDA и глобальным MLA. KDA сжимает предыдущий текст в состояние фиксированного размера, что помогает избежать раздувания кэша при длинных диалогах. Модель не использует явные позиционные метки и может обрабатывать до миллиона токенов без перенастройки RoPE. В K3 также применяются Attention Residuals: каждый слой может выбирать информацию из ранних блоков, а 93 слоя разбиты на 8 блоков по 12. В MoE количество маршрутизируемых экспертов увеличено с 384 до 896, на токен активируются 16 экспертов вместо 8, общих экспертов стало 2 вместо одного. Вычисления выполняются в вдвое более узком латентном пространстве, а результат возвращается в общий поток. Функция активации заменена с SwiGLU на SiTU-GLU, схема балансировки нагрузки — на Quantile Balancing. Moonshot оценивает общий прирост эффективности масштабирования примерно в 2,5 раза. Агентские способности модели улучшены за счёт дообучения. Три специализации — общие задачи, агенты и код — обучались отдельно, каждая на трёх уровнях рассуждения, а затем девять полученных моделей были объединены в одну. Отдельные тренировочные эпизоды включают до тысяч вызовов инструментов, при этом состояние файлов, приложений и виртуальных машин сохраняется между шагами.

Источники 1
  • Moonshot AI опубликовала технический отчёт по Kimi K3 Machinelearning
    📌 Moonshot AI опубликовала техотчёт Kimi K3
    
    Если коротко - от K2 архитектура K3 отличается почти во всём.
    
    🟡Внимание
    
    В K2 все слои (61) работали на одном механизме, MLA. В K3 слоёв 93, и собраны они блоками - 3 слоя KDA и один глобальный MLA, суммарно 69 и 24.
    
    KDA сжимает предыдущий текст в состояние фиксированного размера, поэтому длина диалога перестаёт раздувать кэш.
    
    Явных позиционных меток в модели нет, и она растягивается до миллиона токенов без привычных приёмов вроде перенастройки RoPE.
    
    🟡Residual connections
    
    Обычно слой получает всё накопленное предыдущими слоями одной суммой. 
    
    Attention Residuals позволяют каждому слою выбирать, из каких ранних блоков брать информацию. 93 слоя K3 разбиты на 8 блоков по 12.
    
    🟡MoE
    
    Маршрутизируемых экспертов теперь 896 против 384 у K2, на токен активируются 16 вместо 8, общих экспертов стало 2 вместо одного.
    
    Считают они во вдвое более узком латент спэйсе, чем основной, а результат возвращают в общий поток.
    
    Функцию активации SwiGLU заменили на SiTU-GLU, схему балансировки нагрузки - на Quantile Balancing.
    
    Общий профит Moonshot оценивает примерно в 2,5 раза по эффективности масштабирования.
    
    🟡Агентские способности
    
    Тут сыграло роль не столько железо, сколько дообучение. 3 специализации (общие задачи, агенты, код) обучали отдельно, каждую на трёх уровнях ризонинга, а 9 получившихся моделей слили в одну.
    
    Отдельные тренировочные эпизоды доходят до тысяч вызовов инструментов, причём состояние файлов, приложений и виртуальных машин сохраняется между шагами.
    
    
    🖥Github
    
    
    @ai_machinelearning_big_data
    
    #AI #ML #LLM #KimiK3 #MoonshotAI