Sparse Hash AI


Channel's geo and language: Russia, Russian
Category: Technologies


AI обогатительная разработка ML месторождений. Осторожно, в канале ведутся подрывные работы!

Related channels

Channel's geo and language
Russia, Russian
Statistics
Posts filter


A Controlled Study of Attention-Only Transformers
Контролируемое исследование трансформеров, использующих только внимание
https://www.alphaxiv.org/abs/2607.18363

———

Считается, что слои FFN служат «параметрической памятью» модели, функционируя как хранилища ключ-значение. В работе исследовалась упрощенная архитектура трансформера с удалёнными слоями FFN (Simple Attention Networks, SANs).

При равном количестве параметров разницы в производительности между SAN и FFN-трансформерами практически нет. SAN испытывает трудности только при недостаточном контексте и превосходит модель с FFN, когда его достаточно.

В SAN матрица выходной проекции внимания берёт на себя роль, обычно выполняемую FFN, действуя как основное хранилище изученного контента.




3D реинкарнация восьмибиток

https://d.fixupx.com/voxelphotonics/status/2084106023405818028




A Model with No Head and Many Thoughts
Модель без головы и множеством мыслей
https://www.alphaxiv.org/abs/2608.31069

———

Soft Latent Thinking – метод, который во время рассуждения заменяет LM-голову на легковесный проектор, обеспечивая авторегрессивное развертывание в пространстве эмбеддингов, где шаги рассуждения остаются непрерывными, а не токенизированными.


Forward from: Futuris
Video is unavailable for watching
Show in Telegram
как делают передовые модели🥳🥳🤭


🔥 A Unifying Perspective on Language Model Representations: From Filler-Role Structure to Mechanistic Interpretability
Объединяющая перспектива о представлениях языковых моделей: От ролево-слотовой структуры к механистической интерпретируемости
https://www.alphaxiv.org/abs/2608.29034

———

Представлена гипотеза тензорного произведения представлений (TPR) на замену гипотезе линейного представления (LRH) (предполагающей, что понятия представлены как направления в многомерном векторном пространстве).

В TPR информация скрытого состояния организована в пары наполнителей («что») и ролей («где» или «как»), например: «субъект» – «объект».

Представление понятия является композиционной структурой – это просто сумма тензорных произведений эмбеддингов связываемых пар* с последующей векторизацией.

* как сумма внешних произведений пар ключей и значений в RNN, связывающая и объединяющая их в одно общее состояние

Гипотеза TRP объясняет работу формулы «king − man + woman ≈ queen», линейного зондирования, разреженных автокодировщиков (SAE) и патчинга активаций.

TPR может точно имитировать скрытые состояния реальной, обученной нейронной сети.

Авторы построили собственные зонды-энкодеры и смогли достичь точности классификации, почти идентичной линейным зондам, обученным с помощью стандартных методов машинного обучения.

Также авторы аналитически вывели веса для SAE и обнаружили, что SAE, построенные из TPEs, достигали высокого качества реконструкции и идентифицировали значимые признаки.

Патчинг на основе TPE дал результаты, которые были практически неотличимы от стандартного патчинга, с корреляцией около 1.0.

TPEs аппроксимировали состояния рекуррентных нейронных сетей (RNN и LSTM) с точностью замещения более 99.9%. Это означает, что если заменить внутреннее состояние RNN на рассчитанное состояние TPE, RNN продолжает функционировать идеально.




RiLM: Parameter-Efficient Language Modeling via Geodesic Decoding
RiLM: эффективное языковое моделирование с малым числом параметров посредством геодезического декодирования
https://www.alphaxiv.org/abs/2609.10305

———

Рекуррентная модель с гиперболической геометрией на шаре Пуанкаре.




Global Divergence, Local Convergence: Representation Geometry in SSMs and Transformers
Глобальное расхождение, локальное сближение: геометрия представлений в SSM и трансформерах
https://www.alphaxiv.org/abs/2609.08692

SSM равномерно распределяют информацию о представлениях по всем измерениям, тогда как в представлениях трансформеров доминирует одно главное направление

обе архитектуры обладают практически одинаковой эффективной емкостью

обе архитектуры кодируют понятия в подпространствах удивительно близкой размерности

доминирующее главное направление трансформеров само по себе не кодирует больше концептуальной информации


ARM: Attention with Routed-Memory for Learnable Sparse Control
ARM: внимание с маршрутизируемой памятью для обучаемого разреженного управления
https://www.alphaxiv.org/abs/2609.24417

———

Модель хранит кеш в памяти фиксированного размера, объединяет новую информацию с содержимым выбранных ячеек и позволяет модели выбирать, сколько блоков памяти извлекать для каждого входного текста.




LLM Layers Immediately Correct Each Other
Слои LLM немедленно корректируют друг друга
https://www.alphaxiv.org/abs/2609.07876

———

Слой трансформера избирательно исправляет часть вклада предыдущего слоя, одновременно внося собственный вклад.

В 5 из 7 протестированных моделях следующий слой (attention + MLP) трансформера выборочно удаляет из остаточного потока признаки, только что добавленные в него предыдущим слоем.

Слой i+1 корректирует свой выход в ответ на вклад слоя i, этим занимаются первые две трети слоёв. Анти-корреляция находится между MLP соседних блоков, тогда как вклады attention в среднем положительно коррелируют.

Эта функциональность развивается во время обучения, а не является архитектурной особенностью.

Например, когда токен «202» встречается в числе «1,808,202», слой i может одновременно активировать направления, соответствующие «сотне», «тысяче» и «миллиону», тогда как слой i+1, имея доступ к соседним цифрам, отменяет все направления, кроме «миллиона».






Your Transformer Can Hold Two Thoughts at Once: Evidence of Linear Superposition in LLMs
Ваш трансформер способен одновременно удерживать две мысли: свидетельства линейной суперпозиции в больших языковых моделях
https://www.alphaxiv.org/abs/2609.29845

———

Если на вход LLM одновременно подать усреднённые эмбеддинги от двух входных текстов, то на выходе модель продолжит оба текста сразу (суперпозиция распределений вероятностей следующих токенов).

суперпозиция является внутренним свойством архитектуры Transformer, а не возникающим в результате обучения эффектом

мы предлагаем процедуру управляемого декодирования, которая разделяет суперпозиционные выходы и позволяет одновременно генерировать два связных продолжения за один прямой проход.


A Mathematical Theory of Reusable Neural Bases for Network Compression
Математическая теория повторно используемых нейронных базисов для сжатия сетей
https://www.alphaxiv.org/abs/2609.01550

———

Сокращает число параметров, представляя слои MLP и головы внимания как взвешенные суммы повторно используемых нелинейных базисных функций.

Также предлагает интерпретацию нейронных базисных функций через векторные поля. Разные слои могут выбирать различные комбинации одних и тех же полей, объединяясь, они формируют более разнообразные поля.


Fingers as Legs: Learning Self-Supported Locomotion and Manipulation with an Anthropomorphic Hand
Пальцы вместо ног: обучение самоопорному передвижению и манипулированию с помощью антропоморфной кисти
https://www.alphaxiv.org/abs/2609.17172

https://d.fixupx.com/CyberRobooo/status/2100236102561087547



20 last posts shown.