🔥
A Unifying Perspective on Language Model Representations: From Filler-Role Structure to Mechanistic InterpretabilityОбъединяющая перспектива о представлениях языковых моделей: От ролево-слотовой структуры к механистической интерпретируемости
https://www.alphaxiv.org/abs/2608.29034———
Представлена гипотеза
тензорного произведения представлений (TPR) на замену гипотезе линейного представления (LRH) (предполагающей, что понятия представлены как направления в многомерном векторном пространстве).
В TPR информация скрытого состояния организована в пары
наполнителей («что») и
ролей («где» или «как»), например: «субъект» – «объект».
Представление понятия является композиционной структурой – это просто
сумма тензорных произведений эмбеддингов связываемых пар* с последующей векторизацией.
* как сумма внешних произведений пар ключей и значений в RNN, связывающая и объединяющая их в одно общее состояние
Гипотеза TRP объясняет работу формулы «king − man + woman ≈ queen», линейного зондирования, разреженных автокодировщиков (SAE) и патчинга активаций.
TPR может точно имитировать скрытые состояния реальной, обученной нейронной сети.Авторы построили собственные зонды-энкодеры и смогли достичь точности классификации, почти идентичной линейным зондам, обученным с помощью стандартных методов машинного обучения.
Также авторы аналитически вывели веса для SAE и обнаружили, что SAE, построенные из TPEs, достигали высокого качества реконструкции и идентифицировали значимые признаки.
Патчинг на основе TPE дал результаты, которые были практически неотличимы от стандартного патчинга, с корреляцией около 1.0.
TPEs аппроксимировали состояния рекуррентных нейронных сетей (RNN и LSTM) с точностью замещения более 99.9%. Это означает, что если заменить внутреннее состояние RNN на рассчитанное состояние TPE, RNN продолжает функционировать идеально.