Not the Dimension, the Norm: What Matters in Gradient-Free Weight Perturbation of Language Models
https://www.alphaxiv.org/overview/2608.01624
Это исследование показало, что при адаптации больших языковых моделей без градиентов норма возмущения является единственным надежно влияющим фактором, а не размерность поиска или конкретная геометрия подпространства. Оно показало, что возмущение всего 12-16 скаляров может достичь производительности, сопоставимой с полноразмерным случайным поиском (в пределах 1,8 пункта точности), при этом оптимальные масштабы возмущения находятся в пределах постоянного окна для разных моделей и задач.
———
Уже существуют градиентные методы fine-tuning'а, где подстройка применяется к небольшому числу скаляров. В этой работе предложен безградиентный метод.
Результат подтверждает верность гипотезы Neural Thickets – идеи о том, что эффективные эксперты по задачам плотно расположены вокруг предварительно обученных весов.
Размерность поиска не является критической – четыре подобранных скаляра дают такое же качество как и 1100 скаляров.
Обнаружено, что безградиентному поиску не требуется согласование направления подпространства с сингулярными направлениями исходных весов – оно может быть случайным. Роль SVD заключается в калибровке масштаба возмущений, а не в задаче их направлений.
https://www.alphaxiv.org/overview/2608.01624
Это исследование показало, что при адаптации больших языковых моделей без градиентов норма возмущения является единственным надежно влияющим фактором, а не размерность поиска или конкретная геометрия подпространства. Оно показало, что возмущение всего 12-16 скаляров может достичь производительности, сопоставимой с полноразмерным случайным поиском (в пределах 1,8 пункта точности), при этом оптимальные масштабы возмущения находятся в пределах постоянного окна для разных моделей и задач.
———
Уже существуют градиентные методы fine-tuning'а, где подстройка применяется к небольшому числу скаляров. В этой работе предложен безградиентный метод.
Результат подтверждает верность гипотезы Neural Thickets – идеи о том, что эффективные эксперты по задачам плотно расположены вокруг предварительно обученных весов.
Размерность поиска не является критической – четыре подобранных скаляра дают такое же качество как и 1100 скаляров.
Обнаружено, что безградиентному поиску не требуется согласование направления подпространства с сингулярными направлениями исходных весов – оно может быть случайным. Роль SVD заключается в калибровке масштаба возмущений, а не в задаче их направлений.
Ключом к успешной адаптации является не обязательно в каком направлении вы встряхиваете веса модели, а насколько сильно вы их встряхиваете.