TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
OK ML

9 Jul, 16:15

Открыть в Telegram Поделиться Пожаловаться

Почему внимание — не всегда лучший критерий?

Исследователи из LUMIA Lab (SJTU) и Edinburgh предложили InfoKV  — фреймворк сжатия KV-кэша, который смотрит в будущее! Это как вообще? 🎂

Существующие методы (SnapKV, PyramidKV и др.) выбирают токены по весам внимания, то есть по тому, насколько недавние токены смотрят на прошлые. Это работает для ближнего контекста, но в длинном ризонинге токены важны и для будущих шагов рассуждения. Классический подход предполагает, что важное для текущего контекста останется важным и дальше. Но в длинном ризонинге траектория рассуждения меняется, и токен, который сейчас никому не нужен, может оказаться критичным через тысячи шагов. Авторы показывают это через Forward Influence, влияние высоко-attention токенов быстро затухает с расстоянием, а влияние высокоэнтропийных токенов остаётся сильным даже на горизонте 14K токенов. Интуитивно понятно, кмк. Высокая энтропия при предсказании означает, что токен нес информацию, которую модель не могла вывести из контекста, то есть он содержательный сам по себе.

Кстати, энтропийный скор — это не просто энтропия предсказания, так как она умножается на косинусное расстояние между представлениями токена на промежуточном и последнем слое (плюс bias τ=1), и считается top-k restricted entropy по 256 наиболее вероятным токенам, иначе хвост распределения зашумляет оценку.

Вывод по статье 🍟
Самый эффектный результат статьи — на IFEval для R1-Distill-Llama-8B. При сжатии KV-кэша до 25% и даже 12.5% качество оказалось выше, чем с полным кэшем. Получается, длинные цепочки рассуждений содержат достаточно много малоинформативных токенов, и их удаление экономит память и помогает модели меньше отвлекаться на шум.

P.S. Энтропия сама по себе не заменяет внимание, она дополняет его. В финальной формуле в статье α = 0.9, то есть внимание всё ещё даёт 90% веса, а энтропийный сигнал лишь корректирует выбор. При дальнейшем снижении α качество падает — чистая энтропия хуже на коротких зависимостях (это видно и на Figure 1a, погляди). Так что вывод скорее такой
attention необходим, но недостаточен.

Все!
🤜

407 2 6 30
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot