Эволюция Attention: S4 и работа с длинным контекстом
Продолжаем серию постов про путь линейного внимания. После RWKV стало понятно: чтобы уйти от дорогого Attention, память должна уметь работать с длинным контекстом. Нужно не просто хранить информацию, а обновлять её во времени.
📌 Параллельно с RWKV развивалась архитектура State Space Models (SSM)
Изначально SSM пришла из физики и математики — там использовали такие модели, чтобы описывать системы с памятью.
Что происходит внутри:
То есть память становится не просто суммой прошлого, а динамическим состоянием.
Так как язык — это дискретная последовательность, в SSM добавили параметр Δ. Он отвечает за «шаг времени» между токенами: то, как сильно должна измениться память при переходе от одного токена к другому.
🎨🎨🎨🎨🎨🎨🎨
🎨🎨🎨🎨🎨🎨🎨
📌 Одной из первых успешных реализаций SSM стала архитектура S4
В ней внесли два важных изменения:
• Специальная инициализация матрицы A (HIPPO): позволила модели лучше удерживать длинный контекст и не забывать информацию.
• Параллельные вычисления через свёртки: чтобы не считать состояние для каждого токена по очереди (как в RNN).
Такая модель могла работать с длинными последовательностями, но ей всё ещё не хватало гибкости: каждый входной токен модель обрабатывала одинаково.
Как получилось исправить этот недочёт — расскажем в следующем посте.
💜 Этот пост написал Владислав Попов, ML-инженер в Точка Банк
Продолжаем серию постов про путь линейного внимания. После RWKV стало понятно: чтобы уйти от дорогого Attention, память должна уметь работать с длинным контекстом. Нужно не просто хранить информацию, а обновлять её во времени.
📌 Параллельно с RWKV развивалась архитектура State Space Models (SSM)
Изначально SSM пришла из физики и математики — там использовали такие модели, чтобы описывать системы с памятью.
x'(t) = Ax(t) + Bu(t)
y(t) = Cx(t) + Du(t)
Что происходит внутри:
Входной сигнал преобразуется → смешивается с текущим состоянием (памятью) → состояние обновляется → из него формируется выход.
То есть память становится не просто суммой прошлого, а динамическим состоянием.
Так как язык — это дискретная последовательность, в SSM добавили параметр Δ. Он отвечает за «шаг времени» между токенами: то, как сильно должна измениться память при переходе от одного токена к другому.
🎨🎨🎨🎨🎨🎨🎨
🎨🎨🎨🎨🎨🎨🎨
📌 Одной из первых успешных реализаций SSM стала архитектура S4
В ней внесли два важных изменения:
• Специальная инициализация матрицы A (HIPPO): позволила модели лучше удерживать длинный контекст и не забывать информацию.
• Параллельные вычисления через свёртки: чтобы не считать состояние для каждого токена по очереди (как в RNN).
Такая модель могла работать с длинными последовательностями, но ей всё ещё не хватало гибкости: каждый входной токен модель обрабатывала одинаково.
Как получилось исправить этот недочёт — расскажем в следующем посте.
💜 Этот пост написал Владислав Попов, ML-инженер в Точка Банк