Вот сама модификация градиентного спуска: шаг обновления складывается из двух частей — накопленной инерции предыдущих шагов с коэффициентом μ и градиента функции с коэффициентом η. Ключевое отличие от обычного momentum в том, что градиент вычисляется не в текущей точке, а в предсказанной: там, где мы окажемся, сделав только инерционную часть шага. Обычно μ=0.9, а η — темп обучения (learning rate).
Для машинного обучения, используя классические обозначения, x=w — веса модели, а f(w)=L(θw(*), y) — функция ошибки, где θw(*) — предсказание модели, параметризованной w, а y — искомое значение. При этом градиент берётся по w.
Для машинного обучения, используя классические обозначения, x=w — веса модели, а f(w)=L(θw(*), y) — функция ошибки, где θw(*) — предсказание модели, параметризованной w, а y — искомое значение. При этом градиент берётся по w.