The Transformer Revolution, Part 1: Dynamic Processing through Output- Weight Interconnections
Революция Трансформеров, Часть 1: Динамическая обработка посредством взаимосвязей выходных весов
https://www.alphaxiv.org/overview/2608.03921
Исследователи предлагают новую интерпретацию вывода Трансформера, характеризуя его как Последовательно-уровневую Интерактивную Динамическую Параллельную Обработку (SIDPP), где зависящие от входных данных "связи выход-вес" динамически генерируют параметры преобразования. Это оспаривает точку зрения "стохастического попугая", демонстрируя, что динамические параметры, растущие с длиной запроса, значительно влияют на поведение модели и обеспечивают высокую чувствительность к запросам.
———
Статья делает акцент на том, что трансформер – это нейросеть с динамическим числом параметров *. На инференсе входной токен создаёт новые веса, которыми обрабатывается следующий токен: "результаты одного вычисления напрямую становятся параметрами для следующего".
Трансформер – это растущая нейросеть; динамические веса – это матрицы ключей и значений. Для примера: в GPT-3 на контексте длиной примерно в 39 464 токена количество динамических параметров уже становится равным количеству статических параметров.
* вроде очевидная вещь, вытекающая из архитектуры, что трансформер – это Data-driven, но я сам обратил на это внимание только год-полтора назад ), и вот другие люди это тоже заметили и статью написали )
Революция Трансформеров, Часть 1: Динамическая обработка посредством взаимосвязей выходных весов
https://www.alphaxiv.org/overview/2608.03921
Исследователи предлагают новую интерпретацию вывода Трансформера, характеризуя его как Последовательно-уровневую Интерактивную Динамическую Параллельную Обработку (SIDPP), где зависящие от входных данных "связи выход-вес" динамически генерируют параметры преобразования. Это оспаривает точку зрения "стохастического попугая", демонстрируя, что динамические параметры, растущие с длиной запроса, значительно влияют на поведение модели и обеспечивают высокую чувствительность к запросам.
———
Статья делает акцент на том, что трансформер – это нейросеть с динамическим числом параметров *. На инференсе входной токен создаёт новые веса, которыми обрабатывается следующий токен: "результаты одного вычисления напрямую становятся параметрами для следующего".
Трансформер – это растущая нейросеть; динамические веса – это матрицы ключей и значений. Для примера: в GPT-3 на контексте длиной примерно в 39 464 токена количество динамических параметров уже становится равным количеству статических параметров.
Трансформер — это система, которая "трансформирует концепции посредством концепций".
Трансформер не просто применяет выученные правила; он динамически конструирует новые, специфичные для запроса трансформации во время инференса.
* вроде очевидная вещь, вытекающая из архитектуры, что трансформер – это Data-driven, но я сам обратил на это внимание только год-полтора назад ), и вот другие люди это тоже заметили и статью написали )