Google представила Sparse Selective Caching: память без квадратичной цены
Трансформеры хороши тем, что помнят всё - каждый токен остаётся в KV-кэше, и при необходимости модель может к нему обратиться. Но именно это делает их дорогими: чем длиннее контекст, тем дороже каждый следующий шаг.
RNN устроены наоборот - фиксированный размер памяти, линейная стоимость, но информация вытесняется по мере поступления новой.
Исследователи Google предложили смотреть на это как на спектр между двумя операциями: кэшированием и сжатием. Трансформер кэширует всё, не сжимая ничего. RNN сжимает всё в один скрытый вектор.
Подробности тут.
Трансформеры хороши тем, что помнят всё - каждый токен остаётся в KV-кэше, и при необходимости модель может к нему обратиться. Но именно это делает их дорогими: чем длиннее контекст, тем дороже каждый следующий шаг.
RNN устроены наоборот - фиксированный размер памяти, линейная стоимость, но информация вытесняется по мере поступления новой.
Исследователи Google предложили смотреть на это как на спектр между двумя операциями: кэшированием и сжатием. Трансформер кэширует всё, не сжимая ничего. RNN сжимает всё в один скрытый вектор.
Подробности тут.