Эволюция Attention: эра гибридных моделей
Это завершение серии постов про путь линейного attention. После S4 архитектуры прошли несколько этапов развития:
📌 Mamba — впервые для SSM сделала параметры зависимыми от входа. Благодаря этому модель умеет хранить контекст в памяти и адаптивно решает, что забывать, а что помнить в зависимости от контекста. Поэтому при селективном копировании информации выигрывает у стандартной S4.
📌 DeltaNet — смогла решить проблему «грязной памяти». Каждый раз, когда модель добавляет новую информацию, то выполняет проверку:
• Достаёт из памяти текущее представление вместе с накопленным шумом.
• Оценивает, насколько оно отличается от того, что нужно получить.
• Корректирует состояние — вычитает ошибку и записывает более точное значение.
📌 Гибридные модели — направление, в котором пошёл ряд крупных лабораторий, так как они позволяют совместить сильные стороны разных подходов. Например, Kimi Linear, Qwen3 Next, MiniMax-Text-01 сочетают линейный attention с обычным:
• Линейный attention — хорошо справляется с длинными последовательностями, почти не нагружает память и держит общую картину.
• Обычный attention — точно находит нужные токены и работает с деталями.
Благодаря этому система умеет работать с глобальным контекстом, фокусируется локально и не захлёбывается в шуме.
💜 Серию постов про линейный attention написал Владислав Попов, ML-инженер Точка Банк
Это завершение серии постов про путь линейного attention. После S4 архитектуры прошли несколько этапов развития:
📌 Mamba — впервые для SSM сделала параметры зависимыми от входа. Благодаря этому модель умеет хранить контекст в памяти и адаптивно решает, что забывать, а что помнить в зависимости от контекста. Поэтому при селективном копировании информации выигрывает у стандартной S4.
Главный минус: память со временем накапливает не только полезную информацию, но и ошибки. Когда модель пытается что-то извлечь, то получает не чистый сигнал, а смесь данных и шума (retrieval error). Это особенно заметно на длинных последовательностях.
📌 DeltaNet — смогла решить проблему «грязной памяти». Каждый раз, когда модель добавляет новую информацию, то выполняет проверку:
• Достаёт из памяти текущее представление вместе с накопленным шумом.
• Оценивает, насколько оно отличается от того, что нужно получить.
• Корректирует состояние — вычитает ошибку и записывает более точное значение.
Процесс похож на шаг градиентного спуска: мы уменьшаем ошибку, постепенно подправляя состояние памяти. Таким образом, память перестаёт быть пассивным хранилищем и становится динамической системой, которая умеет самоочищаться.
📌 Гибридные модели — направление, в котором пошёл ряд крупных лабораторий, так как они позволяют совместить сильные стороны разных подходов. Например, Kimi Linear, Qwen3 Next, MiniMax-Text-01 сочетают линейный attention с обычным:
• Линейный attention — хорошо справляется с длинными последовательностями, почти не нагружает память и держит общую картину.
• Обычный attention — точно находит нужные токены и работает с деталями.
Благодаря этому система умеет работать с глобальным контекстом, фокусируется локально и не захлёбывается в шуме.
💜 Серию постов про линейный attention написал Владислав Попов, ML-инженер Точка Банк