🔥
Revisiting Transformer Layer Parameterization Through Causal Energy Minimization
Пересмотр параметризации слоя трансформера посредством минимизации причинной энергии
https://www.alphaxiv.org/overview/2605.07588
Исследователи из Microsoft представили Causal Energy Minimization (CEM) – фреймворк, который переосмысливает слои Трансформера как шаги оптимизации на условных энергетических функциях, формально выводя существующие параметризации Multi-Head Attention и Gated MLP и позволяя разрабатывать новые, более параметрически эффективные варианты. Модели, полученные с помощью CEM, с рекурсивными обновлениями достигли тестовой перплексии, сравнимой с базовыми показателями Llama при умеренных масштабах, используя при этом меньше параметров.
———
Слои attention и MLP – это "физическая" реализация шагов оптимизации энергетических функций. Соответственно, дублирование слоёв как и их зацикливание в "рассуждающих" моделях – это просто несколько дополнительных шагов градиентного спуска минимизации энергетической функции.
Revisiting Transformer Layer Parameterization Through Causal Energy Minimization
Пересмотр параметризации слоя трансформера посредством минимизации причинной энергии
https://www.alphaxiv.org/overview/2605.07588
Исследователи из Microsoft представили Causal Energy Minimization (CEM) – фреймворк, который переосмысливает слои Трансформера как шаги оптимизации на условных энергетических функциях, формально выводя существующие параметризации Multi-Head Attention и Gated MLP и позволяя разрабатывать новые, более параметрически эффективные варианты. Модели, полученные с помощью CEM, с рекурсивными обновлениями достигли тестовой перплексии, сравнимой с базовыми показателями Llama при умеренных масштабах, используя при этом меньше параметров.
———
Слои attention и MLP – это "физическая" реализация шагов оптимизации энергетических функций. Соответственно, дублирование слоёв как и их зацикливание в "рассуждающих" моделях – это просто несколько дополнительных шагов градиентного спуска минимизации энергетической функции.