Почему внимание — не всегда лучший критерий?
Исследователи из LUMIA Lab (SJTU) и Edinburgh предложили InfoKV — фреймворк сжатия KV-кэша, который смотрит в будущее! Это как вообще? 🎂
Существующие методы (SnapKV, PyramidKV и др.) выбирают токены по весам внимания, то есть по тому, насколько недавние токены смотрят на прошлые. Это работает для ближнего контекста, но в длинном ризонинге токены важны и для будущих шагов рассуждения. Классический подход предполагает, что важное для текущего контекста останется важным и дальше. Но в длинном ризонинге траектория рассуждения меняется, и токен, который сейчас никому не нужен, может оказаться критичным через тысячи шагов. Авторы показывают это через Forward Influence, влияние высоко-attention токенов быстро затухает с расстоянием, а влияние высокоэнтропийных токенов остаётся сильным даже на горизонте 14K токенов. Интуитивно понятно, кмк. Высокая энтропия при предсказании означает, что токен нес информацию, которую модель не могла вывести из контекста, то есть он содержательный сам по себе.
Кстати, энтропийный скор — это не просто энтропия предсказания, так как она умножается на косинусное расстояние между представлениями токена на промежуточном и последнем слое (плюс bias τ=1), и считается top-k restricted entropy по 256 наиболее вероятным токенам, иначе хвост распределения зашумляет оценку.
Вывод по статье 🍟
Самый эффектный результат статьи — на IFEval для R1-Distill-Llama-8B. При сжатии KV-кэша до 25% и даже 12.5% качество оказалось выше, чем с полным кэшем. Получается, длинные цепочки рассуждений содержат достаточно много малоинформативных токенов, и их удаление экономит память и помогает модели меньше отвлекаться на шум.
P.S. Энтропия сама по себе не заменяет внимание, она дополняет его. В финальной формуле в статье α = 0.9, то есть внимание всё ещё даёт 90% веса, а энтропийный сигнал лишь корректирует выбор. При дальнейшем снижении α качество падает — чистая энтропия хуже на коротких зависимостях (это видно и на Figure 1a, погляди). Так что вывод скорее такой
Все!
🤜
Исследователи из LUMIA Lab (SJTU) и Edinburgh предложили InfoKV — фреймворк сжатия KV-кэша, который смотрит в будущее! Это как вообще? 🎂
Существующие методы (SnapKV, PyramidKV и др.) выбирают токены по весам внимания, то есть по тому, насколько недавние токены смотрят на прошлые. Это работает для ближнего контекста, но в длинном ризонинге токены важны и для будущих шагов рассуждения. Классический подход предполагает, что важное для текущего контекста останется важным и дальше. Но в длинном ризонинге траектория рассуждения меняется, и токен, который сейчас никому не нужен, может оказаться критичным через тысячи шагов. Авторы показывают это через Forward Influence, влияние высоко-attention токенов быстро затухает с расстоянием, а влияние высокоэнтропийных токенов остаётся сильным даже на горизонте 14K токенов. Интуитивно понятно, кмк. Высокая энтропия при предсказании означает, что токен нес информацию, которую модель не могла вывести из контекста, то есть он содержательный сам по себе.
Кстати, энтропийный скор — это не просто энтропия предсказания, так как она умножается на косинусное расстояние между представлениями токена на промежуточном и последнем слое (плюс bias τ=1), и считается top-k restricted entropy по 256 наиболее вероятным токенам, иначе хвост распределения зашумляет оценку.
Вывод по статье 🍟
Самый эффектный результат статьи — на IFEval для R1-Distill-Llama-8B. При сжатии KV-кэша до 25% и даже 12.5% качество оказалось выше, чем с полным кэшем. Получается, длинные цепочки рассуждений содержат достаточно много малоинформативных токенов, и их удаление экономит память и помогает модели меньше отвлекаться на шум.
P.S. Энтропия сама по себе не заменяет внимание, она дополняет его. В финальной формуле в статье α = 0.9, то есть внимание всё ещё даёт 90% веса, а энтропийный сигнал лишь корректирует выбор. При дальнейшем снижении α качество падает — чистая энтропия хуже на коротких зависимостях (это видно и на Figure 1a, погляди). Так что вывод скорее такой
attention необходим, но недостаточен.
Все!
🤜