Kimi K3: Open Frontier Intelligence
Последний год открытые фронтир-модели сходились примерно к одному классу размеров (около 1T) и конкурировали на эффективности: test-time compute, дешёвый длинный контекст, agentic RL. Moonshot пошли в другую сторону: Kimi K3 — это MoE на 2.8T параметров (104B активных), с native vision и контекстом в 1M токенов. По заявлению авторов, первая открытая модель 3T-класса.
Архитектура собрана вокруг масштабирования "information flow" по трём осям.
- По длине последовательности — гибридное внимание: три слоя Kimi Delta Attention (linear attention с delta rule и channel-wise forget gates, фиксированный state вместо растущего KV-кэша) на один слой глобального Gated MLA. Позиционного кодирования нет вообще (NoPE) — позиция возникает из decay-гейтов KDA, поэтому расширение до 1M токенов обходится без RoPE-хаков.
- По глубине — Attention Residuals: вместо одного накопленного residual stream каждый слой формирует learned pseudo-query и через softmax выбирает, что читать из выходов предыдущих слоёв.
- По ширине — Stable LatentMoE: 896 экспертов, 16 активных на токен, роутинг в латентном пространстве вдвое меньшей размерности, а стабильность при такой sparsity держится на RMSNorm, ограниченной активации SiTU-GLU и Quantile Balancing. Всё вместе даёт примерно 2.5x scaling efficiency относительно K2.
Post-training тоже нетривиальный: после SFT авторы обучают 9 экспертных политик (3 домена на 3 уровня reasoning effort) в agentic-окружениях, а потом сливают их в одну модель через Multi-Teacher On-Policy Distillation — студент генерирует свои rollouts и получает per-token reward от подходящего учителя. Quantization-aware training с MXFP4-весами экспертов идёт с этапа SFT, так что деплой видит ту же арифметику, что и обучение.
В целом модель уступает Claude Fable 5 и GPT-5.6 Sol. Разрыв виден на research-level reasoning и knowledge-work лидербордах. Но круту то, что linear-attention гибрид без позиционного кодирования работает на фронтир-масштабе.
Paper
Code
Project
Мои обзоры:
Personal blog
Medium
Linkedin
#paperreview
Последний год открытые фронтир-модели сходились примерно к одному классу размеров (около 1T) и конкурировали на эффективности: test-time compute, дешёвый длинный контекст, agentic RL. Moonshot пошли в другую сторону: Kimi K3 — это MoE на 2.8T параметров (104B активных), с native vision и контекстом в 1M токенов. По заявлению авторов, первая открытая модель 3T-класса.
Архитектура собрана вокруг масштабирования "information flow" по трём осям.
- По длине последовательности — гибридное внимание: три слоя Kimi Delta Attention (linear attention с delta rule и channel-wise forget gates, фиксированный state вместо растущего KV-кэша) на один слой глобального Gated MLA. Позиционного кодирования нет вообще (NoPE) — позиция возникает из decay-гейтов KDA, поэтому расширение до 1M токенов обходится без RoPE-хаков.
- По глубине — Attention Residuals: вместо одного накопленного residual stream каждый слой формирует learned pseudo-query и через softmax выбирает, что читать из выходов предыдущих слоёв.
- По ширине — Stable LatentMoE: 896 экспертов, 16 активных на токен, роутинг в латентном пространстве вдвое меньшей размерности, а стабильность при такой sparsity держится на RMSNorm, ограниченной активации SiTU-GLU и Quantile Balancing. Всё вместе даёт примерно 2.5x scaling efficiency относительно K2.
Post-training тоже нетривиальный: после SFT авторы обучают 9 экспертных политик (3 домена на 3 уровня reasoning effort) в agentic-окружениях, а потом сливают их в одну модель через Multi-Teacher On-Policy Distillation — студент генерирует свои rollouts и получает per-token reward от подходящего учителя. Quantization-aware training с MXFP4-весами экспертов идёт с этапа SFT, так что деплой видит ту же арифметику, что и обучение.
В целом модель уступает Claude Fable 5 и GPT-5.6 Sol. Разрыв виден на research-level reasoning и knowledge-work лидербордах. Но круту то, что linear-attention гибрид без позиционного кодирования работает на фронтир-масштабе.
Paper
Code
Project
Мои обзоры:
Personal blog
Medium
#paperreview