TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
.ml

30 Jun, 10:02

Открыть в Telegram Поделиться Пожаловаться

Эволюция Attention: эра гибридных моделей

Это завершение серии постов про путь линейного attention. После S4 архитектуры прошли несколько этапов развития:

📌 Mamba — впервые для SSM сделала параметры зависимыми от входа. Благодаря этому модель умеет хранить контекст в памяти и адаптивно решает, что забывать, а что помнить в зависимости от контекста. Поэтому при селективном копировании информации выигрывает у стандартной S4.

Главный минус: память со временем накапливает не только полезную информацию, но и ошибки. Когда модель пытается что-то извлечь, то получает не чистый сигнал, а смесь данных и шума (retrieval error). Это особенно заметно на длинных последовательностях.


📌 DeltaNet — смогла решить проблему «грязной памяти». Каждый раз, когда модель добавляет новую информацию, то выполняет проверку:

• Достаёт из памяти текущее представление вместе с накопленным шумом.
• Оценивает, насколько оно отличается от того, что нужно получить.
• Корректирует состояние — вычитает ошибку и записывает более точное значение.

Процесс похож на шаг градиентного спуска: мы уменьшаем ошибку, постепенно подправляя состояние памяти. Таким образом, память перестаёт быть пассивным хранилищем и становится динамической системой, которая умеет самоочищаться.


📌 Гибридные модели — направление, в котором пошёл ряд крупных лабораторий, так как они позволяют совместить сильные стороны разных подходов. Например, Kimi Linear, Qwen3 Next, MiniMax-Text-01 сочетают линейный attention с обычным:

• Линейный attention — хорошо справляется с длинными последовательностями, почти не нагружает память и держит общую картину.
• Обычный attention — точно находит нужные токены и работает с деталями.

Благодаря этому система умеет работать с глобальным контекстом, фокусируется локально и не захлёбывается в шуме.

💜 Серию постов про линейный attention написал Владислав Попов, ML-инженер Точка Банк
.ml
Эволюция Attention: S4 и работа с длинным контекстом Продолжаем серию постов про путь линейного внимания. После RWKV стало понятно: чтобы уйти от дорогого Attention, память должна уметь работать с длинным контекстом. Нужно не просто хранить информацию, а обновлять её во времени. 📌 Параллельно с ...

2.4k 0 24 7 34
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot