Kimi K3 — открытая мультимодальная MoE-модель на 2,8 трлн параметров и 104 млрд активируемых параметров на токен с контекстным окном до 1 млн токенов. В отчёте она позиционируется как альтернатива закрытым флагманским системам и доступна в открытых весах.

Команда Kimi представила Kimi K3 — открытую мультимодальную модель класса Mixture-of-Experts (MoE) с 2,8 трлн общих параметров и 104 млрд активируемых параметров на токен. Модель поддерживает контекстное окно до 1 млн токенов. В архитектуре Kimi K3 используются гибридное внимание Kimi Delta Attention и Gated Multi-Head Latent Attention в соотношении 3:1, межуровневые связи Block Attention Residuals и Stable LatentMoE с 896 маршрутизируемыми экспертами. Также в модель включён энкодер изображений, обученный с нуля через предсказание следующего токена, и мультиуровневое обучение с подкреплением, дистиллированное из общего, агентного и кодерского доменов. Авторы отчёта отмечают, что Kimi K3 демонстрирует рост эффективности предобучения по сравнению с Kimi K2 и предназначена как открытая альтернатива закрытым флагманским моделям.

Источники 1
  • Kimi K3: открытая мультимодальная MoE-модель с контекстом до 1 млн токенов gonzo-обзоры ML статей
    Топовые опенсорсные модели достигли запредельного уровня, в куче бенчмарков сравнимы с коммерческими фронтир моделями. Сейчас узкое место для взрывного роста доступного интеллекта — это домашние девайсы для инференса таких моделей, чтобы у каждого был свой "бесплатный" аналог Claude Code и не было бы финансово страшно жечь кучу токенов на OpenClaw-подобные эксперименты.
    
    Kimi K3: Open Frontier Intelligence  
    Kimi Team  
    Статья: https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf
    Блог: https://www.kimi.com/blog/kimi-k3  
    Ревью: https://arxiviq.substack.com/p/kimi-k3-open-frontier-intelligence
    Код: https://github.com/MoonshotAI/Kimi-K3  
    Модель: https://huggingface.co/moonshotai/Kimi-K3  
    
    # TL;DR
    
    ЧТО сделали: Команда Kimi представила Kimi K3 — открытую мультимодальную модель типа Mixture-of-Experts (MoE) на 2.8 триллиона общих параметров и 104 миллиарда активируемых параметров на токен, поддерживающую контекстное окно в 1 миллион токенов. Модель сочетает гибридное внимание Kimi Delta Attention и Gated Multi-Head Latent Attention в пропорции 3:1, межуровневые связи Block Attention Residuals по глубине, а также Stable LatentMoE с 896 роутируемыми экспертами. Кроме того, Kimi K3 содержит энкодер изображений, обученный с нуля через предсказание следующего токена, и использует мульти-уровневое обучение с подкреплением (RL), дистиллированное из общего, агентного и кодерского доменов.
    
    ПОЧЕМУ это важно: Пока опенсорс-сообщество активно развивало масштабирование рассуждений на инференсе, размер открытых базовых моделей застрял в районе 1 триллиона параметров, увеличивая отставание от закрытых SOTA-систем. Kimi K3 доказывает, что одновременное масштабирование параметров до 3T-класса и агентного RL на контексте в 1M токенов даёт прирост эффективности предобучения в 2.5 раза по сравнению с Kimi K2 (https://arxiv.org/abs/2507.20534), создавая полноценную открытую альтернативу закрытым флагманам вроде Claude Fable 5 и GPT-5.6 Sol.
    
    Для практиков: Kimi K3 совершает сильный рывок в возможностях открытых моделей за счёт параллельного масштабирования архитектуры и RL. Инженерам и техническим лидерам это даёт готовое к продакшену решение передового уровня с рекордной экономичностью на задачах разработки ПО, сложной работы с инструментами и мультимодальных пайплайнах. Выложив веса на 2.8T и сопутствующие библиотеки, авторы снабдили сообщество инфраструктурой для развёртки сверхбольших архитектур без вспомогательных функций потерь (auxiliary loss) и с микро-ВМ средами для оценки агентов.
    
    Подробности и картинки тут: https://t.me/gonzo_ML_podcasts/4643