TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Data, Stories and Languages

3 Aug, 19:06

Открыть в Telegram Поделиться Пожаловаться

​​Kimi K3: Open Frontier Intelligence

Последний год открытые фронтир-модели сходились примерно к одному классу размеров (около 1T) и конкурировали на эффективности: test-time compute, дешёвый длинный контекст, agentic RL. Moonshot пошли в другую сторону: Kimi K3 — это MoE на 2.8T параметров (104B активных), с native vision и контекстом в 1M токенов. По заявлению авторов, первая открытая модель 3T-класса.

Архитектура собрана вокруг масштабирования "information flow" по трём осям.

- По длине последовательности — гибридное внимание: три слоя Kimi Delta Attention (linear attention с delta rule и channel-wise forget gates, фиксированный state вместо растущего KV-кэша) на один слой глобального Gated MLA. Позиционного кодирования нет вообще (NoPE) — позиция возникает из decay-гейтов KDA, поэтому расширение до 1M токенов обходится без RoPE-хаков.
- По глубине — Attention Residuals: вместо одного накопленного residual stream каждый слой формирует learned pseudo-query и через softmax выбирает, что читать из выходов предыдущих слоёв.
- По ширине — Stable LatentMoE: 896 экспертов, 16 активных на токен, роутинг в латентном пространстве вдвое меньшей размерности, а стабильность при такой sparsity держится на RMSNorm, ограниченной активации SiTU-GLU и Quantile Balancing. Всё вместе даёт примерно 2.5x scaling efficiency относительно K2.

Post-training тоже нетривиальный: после SFT авторы обучают 9 экспертных политик (3 домена на 3 уровня reasoning effort) в agentic-окружениях, а потом сливают их в одну модель через Multi-Teacher On-Policy Distillation — студент генерирует свои rollouts и получает per-token reward от подходящего учителя. Quantization-aware training с MXFP4-весами экспертов идёт с этапа SFT, так что деплой видит ту же арифметику, что и обучение.

В целом модель уступает Claude Fable 5 и GPT-5.6 Sol. Разрыв виден на research-level reasoning и knowledge-work лидербордах. Но круту то, что linear-attention гибрид без позиционного кодирования работает на фронтир-масштабе.

Paper
Code
Project

Мои обзоры:
Personal blog
Medium
Linkedin

#paperreview

1.3k 2 17 13
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot