Новость
Moonshot AI представила модель Kimi K3 с сильными результатами в бенчмарках
Новая модель Kimi K3 от Moonshot AI показывает высокие результаты в тестах и сокращает разрыв между китайскими open-weight-моделями и закрытыми флагманами США. В Frontend Code Arena она заняла первое место, обойдя Claude Fable 5.
Первые бенчмарки для новой модели Kimi K3 от Moonshot AI выглядят очень сильными. По оценке источника, Kimi K3 сокращает разрыв между китайскими open-weight-моделями и закрытыми флагманами США. Согласно Financial Times, K3 должна превзойти Opus 4.8 в ряде бенчмарков, но при этом всё ещё не дотягивает до закрытой Fable. Отдельно Kimi K3 вышла на первое место в Frontend Code Arena с 1679 баллами, обойдя Claude Fable 5. В категории фронтенда модель стала первой в 6 из 7 доменов: Brand & Marketing, Reference-Based Design, Data & Analytics, Consumer Product, Simulations и Content Creation Tools. При этом в материале отмечается, что бенчмарки ещё нужно проверять в реальных сценариях использования, включая coding agents, большие репозитории, 3D, интерфейсы, долгие задачи, стабильность и цену.
-
Moonshot AI представила модель Kimi K3 с сильными результатами в бенчмарках
Data Science by ODS.ai
Kimi K3 может стать моментом DeepSeek 2.0 Первые бенчмарки выглядят очень сильно. Kimi K3 уже называют моделью, которая сокращает разрыв между китайскими open-weight моделями и закрытыми флагманами США. FT пишет, что K3 должна превзойти Opus 4.8 в ряде бенчмарков, но при этом всё ещё не дотягивает до закрытой Fable. Opus 4.8 вышла в конце мая, Anthropic позиционировала её как заметное обновление для agentic-задач, reasoning и работы с инструментами. Если Kimi K3 действительно обходит её в части тестов, тезис «Китай стабильно отстаёт на 6–8 месяцев» становится всё слабее. Отдельно Kimi-K3 уже вышла на первое место в Frontend Code Arena с 1679 pts, обойдя Claude Fable 5. В frontend она стала №1 в 6 из 7 доменов: Brand & Marketing, Reference-Based Design, Data & Analytics, Consumer Product, Simulations и Content Creation Tools. Конечно, бенчмарки ещё нужно проверять реальным использованием: coding agents, большие репозитории, 3D, интерфейсы, долгие задачи, стабильность и цена. Китайские модели всё ближе к frontier-уровню американских закрытых. Kimi K3 - не Fable и не Mythos. Но она уже слишком близко к топовым западным моделям, чтобы относиться к ней как к «ещё одной open model». kimi.com/code/docs/en/kimi-code/models @machinelearning_interview