Moonshot AI опубликовала модель Kimi K3 и технический отчёт о её архитектуре и обучении. В описании также приведены результаты по мультимодальным задачам, кибербезопасности и веб-разработке.

Moonshot AI выложила в открытый доступ модель Kimi K3 и опубликовала технический отчёт. В модели используется архитектура с 2,8 трлн параметров, из которых на каждый токен активируется 104 млрд; задействуется 16 экспертов из 896. Контекст модели составляет 1 млн токенов, при этом позиционное кодирование отсутствует. В отчёте говорится, что MXFP4-квантизация вводится непосредственно во время обучения с подкреплением, а внимание к экономии токенов распространяется и на мультимодальные задачи. На бенчмарке BrowseComp модель показала лучший результат среди открытых решений. Также приводятся результаты по автономным агентным сценариям: за один 48-часовой прогон K3 спроектировала и проверила прототип чипа для ИИ, написала собственный компилятор для ИИ и воспроизвела результат из астрофизики за два часа вместо двух недель. В области кибербезопасности модель сравнивали с GLM-5.2; независимые проверки UK AISI и NIST показали, что она обходит GLM, но не достигает уровня фронтирных моделей. На WebDev Arena Kimi K3 заняла первое место среди 99 моделей. Moonshot AI также опубликовала детали обучения и используемых инструментов, чтобы другие лаборатории могли повторить и улучшить результат.

Источники 1
  • Moonshot AI выпустила открытую модель Kimi K3 с архитектурой MoE и контекстом 1 млн токенов AI Product | Igor Akimov
    Kimi K3 таки выложили в опенсорc
    
    https://huggingface.co/moonshotai/Kimi-K3
    
    И опубликовали отчет.
    
    В общем, ничего супер-нового, но несколько интересных вещей отметил:
    – 2.8T параметров всего, но на каждый токен работает 104B – 16 экспертов из 896.
    – Контекст 1M, а позиционного кодирования нет вообще. Поэтому огромный контекст для нее вообще детский лепет и памяти на него не надо вагонами завозить.
    – MXFP4-квантизацию вводят не после обучения, а прямо во время RL. Модель с самого начала учится жить сжатой, то есть серверную стойку можно взять и поменьше :)
    – Стараются экономно расходовать токены, в том числе в мультимодальности. На BrowseComp лучший результат в мире за $2.03 за задачу. GPT-5.6 Sol вдвое дороже, Клод на максимуме – на порядок
    
    Еще из прикольного:
    – За обучение создали 51 миллион виртуалок-песочниц. Пока модель думает, песочница на паузе и не ест ресурсы вообще – а думает она до 98% времени жизни задачи. Вот на этом простое и сэкономили кучу денег на обучение.
    – За один 48-часовой автономный прогон K3 спроектировала и проверила прототип чипа для ИИ, вообще с нуля. 4 мм², 8700 токенов/с в RTL-симуляции. Исходники выложили на гитхаб
    – Написала свой компилятор для ИИ, обгоняет torch.compile
    – Воспроизвела результат из астрофизики за два часа вместо двух недель: 20+ статей, 300 уравнений состояния, нашла ошибки в опубликованных формулах
    – Смонтировала видео-ролик про собственную архитектуру из 56 клипов
    
    Отдельно про кибербез. Мерились с GLM-5.2. Нашли 16 ранее неизвестных уязвимостей, две в ядре Linux. UK AISI и NIST проверяли независимо: GLM обходит, до фронтира не дотягивает – 0 из 41 на end-to-end эксплойтах. То есть по кибербезопасности модель лучшая из опенсорса.
    
    По бенчмаркам всё то же, что и неделю назад: первое место на WebDev Arena среди 99 моделей (впервые открытая модель возглавила лидерборд живых людей). Про дизайн там читал до этого статью интересную, как топовые модели сейчас стараются в болеее лучший дизайн.
    
    Ну и здорово, что поделились вообще всем, как что работает, как дообучали, как песочницы делали, какие библиотеки использовали. То есть повторить и улучшить сможет любая лаборатория. Вау!
    
    Но у себя дома стойку под 2.8T, правда, всё ещё надо иметь :)
    
    https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf