Фазовый переход в использовании памяти: что это открытие значит для AI-разработчиков? 🟪
Осторожно много буков. 📝
Вы когда-нибудь замечали, что в одних задачах LSTM или Transformer с памятью работают идеально, а в других – только жгут ресурсы без улучшения качества?
Оказывается, выбор между «хранить историю» и «действовать по текущему моменту» – это не плавная настройка, а настоящий фазовый переход первого рода (как таяние льда). И его можно предсказать аналитически. 🪨
Новая статья в Physical Review Letters (плюс 19 страниц матана в Supplemental) даёт чёткие критерии, когда память выгодна, когда нет, а когда возможен гистерезис. Гистерезис – это когда состояние системы зависит не только от текущих параметров, но и от того, как вы к ним пришли (от истории изменения).
Модель в двух словах.
Попытался 📦 всю жесть из материала сублимировать 😐, вышло, как вышло. Не обессудьте.
Итак...
Есть скрытое состояние x(t) – например, концентрация питательного вещества. Вы получаете зашумлённое наблюдение:
y(t) = x(t) + шум.
У вас есть внутренняя переменная z(t) – память, которая эволюционирует по закону:
z = v(t) + шум памяти, где v(t) – это управление: вы сами решаете, как менять память.
За использование управления вы платите штраф Mv^2, прям как кинетическая энергия, чем больше вы «дёргаете» память, тем дороже.
Одновременно вы хотите минимизировать ошибку оценки E[(x - x') ^2] с весом Q. Итоговая функция потерь:
J = Q×ошибка + M×затраты на управление.
Задача – выбрать стратегию v(y,z), которая минимизирует J в стационарном режиме.
В машинном обучении мы часто добавляем L2-регуляризацию:
loss = ошибка + lambda*|w|^2.
При увеличении lambda веса плавно стремятся к нулю. Здесь параметр M играет роль lambda: чем больше M, тем дороже использовать память, и казалось бы, при больших M коэффициент при памяти должен плавно уменьшаться до нуля.
Но здесь есть две связанные переменные (текущее наблюдение и как память на себя же влияет), которые влияют на поведение системы и друг на друга.
Они не независимы. Оптимизация потерь J по этим двум переменным приводит к тому, что на их плоскости, могут существовать два локальных минимума – с памятью и без. Между ними – горный хребет (седловая точка). Когда параметры (например, M) меняются, один из минимумов может исчезнуть или стать глобальным. В момент исчезновения система скачком перескакивает из одной ямы в другую – это и есть фазовый переход.
Суть открытия на пальцах.
Представьте агента, который наблюдает за шумным сигналом и может хранить внутреннее состояние z. Обновление z стоит ресурсов (штраф M). Задача – минимизировать ошибку оценки при ограниченном бюджете.
Авторы доказали:
· Существуют два порога Theta_Q и Theta_M:
· Если Theta_Q < 1 — память точно бесполезна (даже локально).
· Если Theta_M >=1 — память всегда выгодна (глобальный оптимум).
· Между ними – бистабильность: обе стратегии локально оптимальны, выбор зависит от истории (гистерезис).
А теперь разбираем, что из этого можно вынести для AI. 🥴
1. Оптимизация архитектур с памятью (LSTM, Transformer, RNN)
Современные модели с памятью, например, трансформеры с окном внимания или LSTM, всегда используют память, даже когда она не нужна.
Результаты подсказывают:
· При высоком шуме в данных память становится бесполезной – лучше полагаться только на текущий вход. Это объясняет, почему в некоторых задачах обрезка контекста (например, короткое окно внимания) не ухудшает качество.
· При быстро меняющейся среде прошлая информация устаревает – нужно динамически уменьшать размер буфера или использовать забывание, как в LSTM, но с адаптивным коэффициентом.
2. Регуляризация и штраф за сложность в RL.
В RL агент часто хранит внутреннее состояние например, в PPO. Штраф Mv^2 в статье – аналог штрафа за изменение скрытого состояния. Это можно использовать:
· Как регуляризатор в функциях потерь, чтобы поощрять агента использовать память только когда это действительно выгодно.
· Аналитические пороги Theta_Q,Theta_M помогают автоматически подбирать коэффициент регуляризации M без дорогой сетки гиперпараметров – просто по статистике шумов среды. Это особенно полезно в Meta-RL, где среда меняется между эпизодами.
3. Continuous Learning и катастрофическое забывание.
В задачах continual learning модели должны сохранять знания о прошлых задачах, но обновление памяти (весов) стоит ресурсов. Аналогия:
· Параметр M – штраф за изменение весов.
· Фазовый переход означает, что при превышении порога штрафа модель перестаёт обновлять веса вообще – т.е. замораживает их. Это даёт критерий, когда лучше полностью остановить обучение (если среда не меняется) или, наоборот, разморозить (если волатильность растёт).
На практике это позволяет строить адаптивные стратегии обновления – не тратить ресурсы на веса, которые не нужны.
Вот такое интересное исследование. Читайте полную версию, применяйте открытие, и stay tuned 🦾
Осторожно много буков. 📝
Вы когда-нибудь замечали, что в одних задачах LSTM или Transformer с памятью работают идеально, а в других – только жгут ресурсы без улучшения качества?
Оказывается, выбор между «хранить историю» и «действовать по текущему моменту» – это не плавная настройка, а настоящий фазовый переход первого рода (как таяние льда). И его можно предсказать аналитически. 🪨
Новая статья в Physical Review Letters (плюс 19 страниц матана в Supplemental) даёт чёткие критерии, когда память выгодна, когда нет, а когда возможен гистерезис. Гистерезис – это когда состояние системы зависит не только от текущих параметров, но и от того, как вы к ним пришли (от истории изменения).
Модель в двух словах.
Попытался 📦 всю жесть из материала сублимировать 😐, вышло, как вышло. Не обессудьте.
Итак...
Есть скрытое состояние x(t) – например, концентрация питательного вещества. Вы получаете зашумлённое наблюдение:
y(t) = x(t) + шум.
У вас есть внутренняя переменная z(t) – память, которая эволюционирует по закону:
z = v(t) + шум памяти, где v(t) – это управление: вы сами решаете, как менять память.
За использование управления вы платите штраф Mv^2, прям как кинетическая энергия, чем больше вы «дёргаете» память, тем дороже.
Одновременно вы хотите минимизировать ошибку оценки E[(x - x') ^2] с весом Q. Итоговая функция потерь:
J = Q×ошибка + M×затраты на управление.
Задача – выбрать стратегию v(y,z), которая минимизирует J в стационарном режиме.
В машинном обучении мы часто добавляем L2-регуляризацию:
loss = ошибка + lambda*|w|^2.
При увеличении lambda веса плавно стремятся к нулю. Здесь параметр M играет роль lambda: чем больше M, тем дороже использовать память, и казалось бы, при больших M коэффициент при памяти должен плавно уменьшаться до нуля.
Но здесь есть две связанные переменные (текущее наблюдение и как память на себя же влияет), которые влияют на поведение системы и друг на друга.
Они не независимы. Оптимизация потерь J по этим двум переменным приводит к тому, что на их плоскости, могут существовать два локальных минимума – с памятью и без. Между ними – горный хребет (седловая точка). Когда параметры (например, M) меняются, один из минимумов может исчезнуть или стать глобальным. В момент исчезновения система скачком перескакивает из одной ямы в другую – это и есть фазовый переход.
Суть открытия на пальцах.
Представьте агента, который наблюдает за шумным сигналом и может хранить внутреннее состояние z. Обновление z стоит ресурсов (штраф M). Задача – минимизировать ошибку оценки при ограниченном бюджете.
Авторы доказали:
· Существуют два порога Theta_Q и Theta_M:
· Если Theta_Q < 1 — память точно бесполезна (даже локально).
· Если Theta_M >=1 — память всегда выгодна (глобальный оптимум).
· Между ними – бистабильность: обе стратегии локально оптимальны, выбор зависит от истории (гистерезис).
А теперь разбираем, что из этого можно вынести для AI. 🥴
1. Оптимизация архитектур с памятью (LSTM, Transformer, RNN)
Современные модели с памятью, например, трансформеры с окном внимания или LSTM, всегда используют память, даже когда она не нужна.
Результаты подсказывают:
· При высоком шуме в данных память становится бесполезной – лучше полагаться только на текущий вход. Это объясняет, почему в некоторых задачах обрезка контекста (например, короткое окно внимания) не ухудшает качество.
· При быстро меняющейся среде прошлая информация устаревает – нужно динамически уменьшать размер буфера или использовать забывание, как в LSTM, но с адаптивным коэффициентом.
2. Регуляризация и штраф за сложность в RL.
В RL агент часто хранит внутреннее состояние например, в PPO. Штраф Mv^2 в статье – аналог штрафа за изменение скрытого состояния. Это можно использовать:
· Как регуляризатор в функциях потерь, чтобы поощрять агента использовать память только когда это действительно выгодно.
· Аналитические пороги Theta_Q,Theta_M помогают автоматически подбирать коэффициент регуляризации M без дорогой сетки гиперпараметров – просто по статистике шумов среды. Это особенно полезно в Meta-RL, где среда меняется между эпизодами.
3. Continuous Learning и катастрофическое забывание.
В задачах continual learning модели должны сохранять знания о прошлых задачах, но обновление памяти (весов) стоит ресурсов. Аналогия:
· Параметр M – штраф за изменение весов.
· Фазовый переход означает, что при превышении порога штрафа модель перестаёт обновлять веса вообще – т.е. замораживает их. Это даёт критерий, когда лучше полностью остановить обучение (если среда не меняется) или, наоборот, разморозить (если волатильность растёт).
На практике это позволяет строить адаптивные стратегии обновления – не тратить ресурсы на веса, которые не нужны.
Вот такое интересное исследование. Читайте полную версию, применяйте открытие, и stay tuned 🦾