TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Sparse Hash AI

4 Oct, 12:40

Открыть в Telegram Поделиться Пожаловаться

🔥 A Unifying Perspective on Language Model Representations: From Filler-Role Structure to Mechanistic Interpretability
Объединяющая перспектива о представлениях языковых моделей: От ролево-слотовой структуры к механистической интерпретируемости
https://www.alphaxiv.org/abs/2608.29034

———

Представлена гипотеза тензорного произведения представлений (TPR) на замену гипотезе линейного представления (LRH) (предполагающей, что понятия представлены как направления в многомерном векторном пространстве).

В TPR информация скрытого состояния организована в пары наполнителей («что») и ролей («где» или «как»), например: «субъект» – «объект».

Представление понятия является композиционной структурой – это просто сумма тензорных произведений эмбеддингов связываемых пар* с последующей векторизацией.

* как сумма внешних произведений пар ключей и значений в RNN, связывающая и объединяющая их в одно общее состояние

Гипотеза TRP объясняет работу формулы «king − man + woman ≈ queen», линейного зондирования, разреженных автокодировщиков (SAE) и патчинга активаций.

TPR может точно имитировать скрытые состояния реальной, обученной нейронной сети.

Авторы построили собственные зонды-энкодеры и смогли достичь точности классификации, почти идентичной линейным зондам, обученным с помощью стандартных методов машинного обучения.

Также авторы аналитически вывели веса для SAE и обнаружили, что SAE, построенные из TPEs, достигали высокого качества реконструкции и идентифицировали значимые признаки.

Патчинг на основе TPE дал результаты, которые были практически неотличимы от стандартного патчинга, с корреляцией около 1.0.

TPEs аппроксимировали состояния рекуррентных нейронных сетей (RNN и LSTM) с точностью замещения более 99.9%. Это означает, что если заменить внутреннее состояние RNN на рассчитанное состояние TPE, RNN продолжает функционировать идеально.

48 0 5 1 3
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot