TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Похек AI

27 Jul, 21:35

Открыть в Telegram Поделиться Пожаловаться

00:15
Kimi K3: как устроена модель на 2,8 трлн параметров

K3 содержит 2,78 трлн параметров, но на каждом токене активирует 104,2 млрд. В модели 93 слоя, 896 маршрутизируемых экспертов — одновременно работают только 16 — и контекстное окно на 1 048 576 токенов. Веса занимают около 1,56 ТБ.

Гибридное внимание. Архитектура повторяет схему KDA → KDA → KDA → Gated MLA. KDA хранит рекуррентное состояние фиксированного размера вместо растущего KV-кеша, а каждый четвёртый слой MLA возвращает глобальное взаимодействие между токенами. Moonshot также ограничила коэффициент затухания KDA: небольшое изменение формулы позволило убрать отдельный медленный путь из ядра для графического процессора.
Глубина и эксперты. Attention Residuals позволяет слоям обращаться к представлениям предыдущих блоков, а не только к суммарному остаточному потоку. LatentMoE сжимает маршрутизируемую ветвь с 7 168 до 3 584 измерений. Квантильная балансировка и MoonEP перераспределяют нагрузку и временно копируют перегруженных экспертов, чтобы процессы получали одинаковое число токенов.

Обучение агентов. Длинные траектории могут включать сотни вызовов инструментов. Система не ждёт завершения всех попыток: незаконченная траектория вместе с состоянием внешней среды сохраняется и продолжается после обновления политики. Девять специализированных политик — общих, агентных и программистских, в трёх режимах рассуждения — затем объединили в одну модель.

Контекст в миллион токенов потребовал отдельного кеша. K3 одновременно обслуживает фиксированные состояния KDA и растущий KV-кеш MLA. Префикс можно использовать повторно только при согласованном состоянии обоих механизмов. При спекулятивном декодировании модель хранит компактные проекции входа и повторно вычисляет принятые токены непосредственно на кристалле.

Поиск уязвимостей. Moonshot заявляет о 16 ранее неизвестных ошибках в шести проектах и примерно 70% подтверждений среди отобранных для проверки находок. Но методика отбора, полный список целей и слепая контрольная оценка не опубликованы. В независимом исследовании AISI/CAISI K3 набрала 32% на ExploitBench, но не выполнила ни одного из 41 задания на произвольное выполнение кода.

Главное ограничение отчёта — воспроизводимость. Ну как бы для запуска вам понадобиться как минимум 1Тб видеопамяти или хоть какой-то памяти, чтобы запустить в 4bit или 2bit, не помню. Ждём очень сильно разряженных версий моделей, с надеждой что качество ответов не упадёт ниже 90% от FP8

🔗Полный мой технический разбор: Как устроена Kimi K3

🌚 @poxek_ai / Чат канала

4.9k 3 63 7 10
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot